편집 아카이브
현지 시각
← 홈으로 돌아가기
0003

문서

노트 · 모델

Qwen3.8 오픈: 알리바바, 27B·2.4T 웨이트를 두 가지 라이선스로 공개

8월 3일 발표 11일 만에 Qwen3.8 세대의 두 모델 웨이트가 모두 공개됐다. Apache 2.0의 27B 멀티모달 밀집 모델과 커스텀 라이선스의 2.4T MoE 플래그십이다.

목차
  1. 01 · 한 세대, 두 개의 오픈 웨이트
  2. 02 · 하이브리드 어텐션과 조절식 추론
  3. 03 · 벤더 보고 평가 수치
  4. 04 · 라이선스와 당일 생태계
  5. 05 · 출처

한 세대, 두 개의 오픈 웨이트

알리바바가 Qwen3.8 세대의 두 모델 웨이트를 이번 주 모두 공개했다: 기본형 27B 밀집 모델은 내장형 멀티모달이고, 2.4T 매개변수 MoE 플래그십은 추론 중 약 95B만 활성화한다. ² 이 세대는 2026년 8월 3일에 발표됐으며, 그날 Qwen3.8-Max가 유료 API로 출시되면서 알리바바는 ‘약 일주일 안에’ 두 모델 모두 오픈 웨이트를 내겠다고 약속했다. ³ 두 모델의 웨이트는 8월 14일 Hugging Face에 공개됐고, 27B 저장소는 같은 날 저녁 ModelScope에도 올라오며 공개 시점 논란이 마무리됐다. ²³ 27B는 Max 플래그십과 짝을 이루는 밀집형·자체 호스팅 모델이며 널리 쓰이던 Qwen3.6-27B의 후속작이다. ³ 큐원(Qwen) 팀은 이번이 ‘Max급’ 성능의 첫 공개 릴리스로, 그간 해당 성능은 상업용 API 뒤에만 존재한 계층이라고 설명한다. ² 반응도 빠르다. 출시 직후 27B 저장소는 이미 267K 이상 다운로드를 기록했다. ¹

하이브리드 어텐션과 조절식 추론

두 모델 모두 빠른 선형 레이어와 전체 셀프어텐션 블록을 번갈아 쌓는 새 구조를 사용한다. 게이트드 델타넷(Gated DeltaNet) 레이어 3개와 전체 어텐션 레이어 1개가 망 전체에 걸쳐 반복되는 패턴이다. ² 27B 변형은 히든 차원 5120에 트랜스포머 레이어 64개를 쌓고, 2.4T 모델은 레이어 92개·히든 차원 8192로 올린다. ² Hugging Face에서 27B는 이미지-텍스트-텍스트 모델로 등록되어 있으며 BF16 기준 약 27.8B 파라미터를 가진다. ¹ 텍스트·이미지·비디오·다이어그램·문서를 처리하는 내장형 멀티모달이고, 기본 262K 토큰 컨텍스트를 YaRN으로 1M까지 확장하며, 계산 비용을 조절하는 reasoning_effort 설정을 지원한다. ³ MoE는 512개 라우팅 전문가 가운데 토큰당 10개와 공유 전문가 1개만 활성화해 실제 연산량을 약 95B 파라미터 수준으로 유지한다. ² 27B는 간단한 프롬프트에서 추론을 끌 수 있지만(enable_thinking=False), 대형 MoE 모델은 항상 사고한다. ²

벤더 보고 평가 수치

알리바바 자체 평가에서 27B는 전작과 더 큰 Qwen3.7-Plus조차 상회한다: SWE-bench Pro 61.7(Qwen3.6-27B는 53.5), 에이전트 터미널 코딩 73.0(63.4), JobBench 33.4(21.8). ³ 이는 모두 벤더 보고 수치로, 아직 어떤 독립 벤치마크도 27B 점수를 발표하지 않았기에 커뮤니티가 재현해야 할 주장으로 봐야 한다. ³ 모델 카드에는 DeepSwe 42.2, GPQA Diamond 89.2, HLE 30.8, ClawEval-MM 57.4 등도 실려 있으며, SWE-bench Pro 수치는 클로드 코드 하네스로 평가됐다. ¹ 대형 MoE 모델은 SWE-bench Pro 67.7, DeepSWE 1.1 56.6을 기록했고 PaperBench에서는 테스트한 모든 벤치마크 중 가장 높은 93.0을 받았지만, 가장 어려운 코딩 과제에서는 여전히 소폭 뒤처진다. ²

라이선스와 당일 생태계

라이선스에서 두 릴리스는 갈린다. 27B는 Apache 2.0으로 배포된다. 사용자 수 상한도, 상업 논의 트리거도 없는 허용적 라이선스다. 따라서 이전에 우려되던 통이 첸원(Tongyi Qianwen) 라이선스의 100M MAU 조항이 밀집 모델에는 적용되지 않았다. ³ 반면 2.4T 플래그십은 커스텀 라이선스 아래 놓여 Max급 릴리스로서의 위상을 반영하며, 이로써 이 세대는 이층 라이선스 구조를 갖게 됐다. ² 그 덕분에 27B가 제품·에이전트 연동의 가장 낮은 장벽 경로가 된다. ³ 출시 시점부터 SGLang·vLLM·TokenSpeed가 추론을 지원했고, 커뮤니티는 모델별로 llama.cpp·Ollama·LM Studio·Jan용 양자화 변형 17개를 내놓았다. ² 27B는 공개 몇 시간 안에 상업용 API 마켓플레이스에도 등재됐는데, 이는 단순 다운로드를 넘어 관리형 API로도 제공되기 시작했다는 신호다. ³

출처

이어지는 글

같은 베이스, 포스트트레이닝만으로: Z.ai가 자체적으로 지목한 GLM-5.3의 사이버 점프

743B 모델 GLM-5.3은 GLM-5.2와 동일한 베이스를 재사용하고 개선 전부를 포스트트레이닝 스케일링에서 얻었다. 벤더는 이번 릴리스에서 '의외로 나타난' 취약점 공격 역량까지 스스로 경고한다.

글 읽기 →