Alibaba Qwen3.8-Max 출시:
2.4조 파라미터 Arena 글로벌 5위, 다음 주 오픈소스

국산 flagship 대규모 모델 도입, Agent 워크플로 이전, API 비용 최적화를 검토하는 AI 개발자와 기술 책임자에게 8월 3일 Alibaba가 정식 GA한 Qwen Qwen3.8-Max는 「2.4조 파라미터 + 다음 주 오픈소스」 조합에 대한 인식을 바꿀 수 있는 출시입니다. 총 2.4조 파라미터, 활성 9500억, 100만 token 컨텍스트, Arena 텍스트 경기장 5위(상위 8개 중 유일한 비 Anthropic 모델), Agent 제품 Qwen Office도 동시 출시되었습니다. 본문은 2주 타임라인, 핵심 벤치마크 표, MoE 아키텍처 분해, Kimi K3 / DeepSeek V4 / Claude 횡단 비교, 오픈소스 라벨 논란, 6단계 도입 체크리스트와 FAQ를 정리합니다. Kimi K3 가중치 공개편, GPT-5.6 인하편, Apple Intelligence 중국판편과 함께 읽으시기 바랍니다. 요금은 요금 페이지를 참고하세요.

  • 7월 16일: Moonshot AI가 Kimi K3를 출시했습니다. 총 2.8조 파라미터(896개 전문가 중 16개 활성), 독립 평가와 투명한 기술 보고서 노선을 내세웠습니다.
  • 7월 19일: Qwen3.8-Max가 「프리뷰」로 선행 공개되었습니다. Token Plan / Qoder / QoderWork에 연결되고 정식 가격의 10%로 제공되었지만, 활성 파라미터와 벤치마크 표는 미공개였고 이용약관은 자동화 생산 환경 호출을 명시적으로 금지했습니다.
  • 7월 27일: Kimi K3가 약속대로 가중치를 공개하고 Hugging Face에 올렸습니다. 어텐션 커널·MoE 통신 라이브러리 등 일부 Infra도 동시 오픈했습니다.
  • 7월 31일: DeepSeek가 V4-Flash 정식판을 발표했습니다. 파라미터 규모는 유지한 채 아키텍처·학습 최적화로 에이전트·코드 벤치마크를 자사 V4-Pro 프리뷰를 크게 넘겼습니다.
  • 8월 3일: Qwen3.8-Max 정식 GA(전량 이용 가능). 전체 벤치마크 표를 공개하고 Agent 제품 Qwen Office도 Tencent WorkBuddy·Moonshot Kimi Work에 맞서 동시 론칭했습니다. 당일 Alibaba 주가는 홍콩 약 7%, 미국 약 4.5% 상승했습니다.
  • 8월 10일 전후(예정): Qwen3.8-Max와 경량 Qwen3.8-27B 가중치가 Hugging Face·ModelScope에 올라갈 계획이지만, 집필 시점에는 구체적 일정과 라이선스 조항이 공개되지 않았습니다.

결론: Qwen3.8-Max는 Arena 텍스트 경기장 상위 8개 중 유일하게 비 Anthropic으로 들어간 모델입니다. 하지만 벤치마크는 모두 Alibaba 자체 측정이고, 제3자 권위 기관의 정식 평가는 아직 없습니다. 「글로벌 1티어」 평가에는 독립 검증이 필요합니다.

정보 공개 쟁점(프리뷰 단계부터 독립 평가 기관이 지적):

  • 활성 파라미터 지연 공개: 프리뷰 기간에는 활성 파라미터가 전혀 공개되지 않았고 GA 단계에서야 「9500억」이 추가되었습니다.
  • 생산 환경 금지: 7월 19일 프리뷰 이용약관은 자동화 생산 환경 호출을 명시 금지했고, 여러 독립 기관이 「자체 업무에서 시험하고 생산 이전은 하지 말라」고 권고했습니다.
  • 오픈소스 라벨 선행: 공식 사이트는 GA 당일부터 Open-Source로 표시하지만, 집필 시점 Hugging Face·ModelScope에는 대응 저장소가 없습니다.
  • 벤치마크 방법론 불투명: PaperBench, QwenSWEBench, RecreationBench 등 내부 벤치마크에 대해 Artificial Analysis 등 중립 기관의 정식판 독립 재측정이 아직 없습니다.

Qwen3.8-Max 핵심 파라미터(출처: Alibaba 공식 발표, 2026-08-03)
항목
출시일2026년 8월 3일(GA)
총 / 활성 파라미터2.4조 / 9500억
아키텍처Qwen3.5 기반 sparse MoE + 하이브리드 어텐션
컨텍스트 윈도100만 token(사고 모드 약 98.3만, 출력 상한 13.1만)
입력 모달리티텍스트 / 이미지 / 동영상
API 요금입력 $2/백만 token, 출력 $6/백만 token
중국 내 요금입력 12원/백만 token, 출력 36원/백만 token, 캐시 히트 최저 1.5원
Arena 텍스트 경기장(8월 1일 스냅샷)5위, 1496점(Preliminary)
Arena 비주얼 경기장2위, Claude Fable 5에 다음
PaperBench(Alibaba 자체)93.0(전세대 대비 +28.2점)
SWE-bench Pro(Alibaba 자체)67.7(Fable 5 80.0에 뒤짐)
가중치 공개 상태「다음 주」 약속, 집필 시점 미공개

표의 「Alibaba 자체」 표기 데이터는 모두 Alibaba 공식 자료에서 나왔고, Artificial Analysis·Arena.ai의 제3자 정식 재측정은 아직 없습니다.

왜 MoE + 하이브리드 어텐션인가, 단순 파라미터 적층이 아닌 이유: sparse MoE로 총 2.4조를 달성하면서 실제 활성량은 9500억으로 제한합니다. 추론 비용은 천억급 모델에 가깝고 2.4조를 통째로 호출하지 않습니다. 이것이 API 요금을 입력 $2/M·출력 $6/M로 낮춰 Claude Opus 5($5/$25)·Claude Fable 5($10/$50) 아래로 잡는 이유입니다.

reasoning_effort 3단 설계: low / medium / xhigh 3단(기본 xhigh)으로 추론 깊이와 속도를 조절할 수 있습니다. enable_thinking 파라미터 또는 Anthropic 호환 인터페이스의 reasoning.effort 필드로 호출합니다.

flagship 대규모 모델 횡단 비교(2026년 8월 초 공개 정보)
모델 총/활성 파라미터 요금(입력/출력, 백만 token) 가중치 공개 독립 제3자 평가
Qwen3.8-Max 2.4T / 9500억 $2 / $6 미공개(약속 중) 없음
Kimi K3 2.8T / 약 5000억 $3 / $15 공개(7월 27일) Artificial Analysis 약 57.11점
DeepSeek V4-Flash 불변(V4-Pro 대비) 전체 표 미공개 공개 9개 에이전트/코드 벤치에서 V4-Pro 초과
Claude Opus 5 비공개 $5 / $25 폐쇄 Arena 텍스트 상위
Claude Fable 5 비공개 $10 / $50 폐쇄 Arena 텍스트 1위

놓치기 쉬운 점: Kimi K3는 활성 파라미터 약 5000억을 공개했고 DeepSeek 계열도 4900억을 밝혔습니다. Alibaba는 GA 단계에서야 「9500억」을 공개했고, 7월에 여러 독립 기관이 「투명성 부족」을 지적한 배경 중 하나입니다.

유일한 독립 맹평가(동일 269개 파일의 실제 프로젝트 아키텍처 설계 과제, 맹심 채점)에서 Kimi K3 83점, Qwen3.8-Max 프리뷰 80점으로 격차가 작아 「호각 승부」에 가깝습니다.

「오픈소스」 라벨이 가중치보다 먼저 붙은 네 가지 경고 신호:

  1. 공식은 Open-Source 표시, 가중치는 미공개. 집필 시점 Hugging Face·ModelScope에 저장소·라이선스·확정 일정이 없습니다.
  2. 벤치마크는 모두 Alibaba 자체 프레임워크에서 나왔고 PaperBench, QwenSWEBench, RecreationBench 등 내부 기준을 포함합니다.
  3. 비교표 각주가 경쟁 데이터를 의심: Alibaba 공표 표 각주에 「Fable 5 결과는 fallback(모델 강등 라우팅) 가능성」이 있지만, Alibaba 측 테스트 방법도 제3자 재현 가능 수준까지 공개되지 않았습니다.
  4. 프리뷰 단계 투명성 문제: 7월 19일 프리뷰는 활성 파라미터·모델 카드·안전 평가 보고를 공개하지 않았고, 여러 기관이 생산 이전을 권고했습니다.

  1. 연결 경로 확정: QwenCloud API(OpenAI·Anthropic 이중 프로토콜)와 Qwen3.8-27B 가중치 공개 후 로컬 배포를 평가합니다. 대부분 팀은 API가 정답이고, 전체 2.4T는 다중 노드 데이터센터급 하드가 필요합니다. OpenRouter 도입 가이드로 멀티 프로바이더 추상화를 검토하세요.
  2. 이용약관·요금 정독: 암시적 캐시 히트 $0.25/M, 명시적 캐시 쓰기 $2.5/M, 읽기 $0.17/M 과금 규칙을 확인합니다. 중국 내판은 입력 12원/M, 출력 36원/M, 캐시 히트 최저 1.5원입니다.
  3. API 클라이언트 설정: QwenCloud에서 API Key를 받고 base URL을 Alibaba 공식 엔드포인트로 지정합니다. 기존 OpenAI SDK·Anthropic SDK 프로젝트는 base URL과 모델 ID만 바꿔 Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw 등 주요 Agent 도구에 연결할 수 있습니다.
  4. reasoning_effort 단계 설정: 과제 난이도에 따라 low / medium / xhigh(기본 xhigh)를 선택합니다. 단순 과제는 저단계로 비용을 줄이고, 복잡한 Agent 오케스트레이션은 xhigh로 깊이를 우선합니다.
  5. 계층 라우팅 구축: 일상 Agentic Coding은 Qwen3.8-Max나 DeepSeek V4-Flash로 처리하고, 막히는 단계는 Claude Opus 5·GPT-5.6 Sol로 에스컬레이션합니다. 단일 모델 과금 폭주를 막습니다. 7월 OpenRouter 계층 선정을 참고하세요.
  6. 7×24 Agent 실행 환경 고정: 장시간 Agent 오케스트레이션(Alibaba가 보여준 16일 무인 코딩 프로젝트 등)은 덮으면 슬립되는 노트북이 아니라 상시 가동 macOS 노드가 필요합니다. 고객 센터주문 페이지를 참고하세요.
qwen3-8-max-api-example.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_QWEN_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Explain sparse MoE architecture in one paragraph."}],
    extra_body={"enable_thinking": True}
)
print(response.choices[0].message.content)

  • 총 / 활성 파라미터: 2.4조 / 9500억. MoE에서 추론 비용은 활성량을 따름(출처: Alibaba GA 공고, 2026-08-03).
  • Arena 텍스트 경기장: 5위, 1496점(Preliminary). 상위 8 중 유일 비 Anthropic(출처: Arena.ai, 8월 1일 스냅샷).
  • API 요금 우위: 입력 $2/M, 출력 $6/M. Claude Opus 5($5/$25)·Fable 5($10/$50) 아래(출처: Alibaba 요금 페이지).
  • 독립 맹평가 비교: 동일 269파일 아키텍처 과제에서 Kimi K3 83점, Qwen3.8-Max 프리뷰 80점(출처: 제3자 독립 평가).
  • 자본시장 반응: 발표 당일 Alibaba 주 홍콩 약 7%, 미국 약 4.5% 상승(출처: 공개 시세).
  • 소비자 확장: Qwen은 Apple 협력으로 중국판 Apple Intelligence 생성 AI 핵심(압축 후 로컬 실행)(출처: TechCrunch 등).
  • 가중치 공개 예정: Qwen3.8-Max·Qwen3.8-27B는 8월 10일 전후 Hugging Face·ModelScope, 확정일은 공식 대기.

업계 배경: 2026년은 조급 파라미터 모델의 「확산 해」입니다. 4월 DeepSeek V4-Pro 1.6조로 시작, 7월 Qwen3.8-Max 프리뷰 2.4조, 같은 달 Kimi K3 2.8조로 세계 open weight 규모 기록을 경신했습니다. 7월 31일 DeepSeek V4-Flash는 「파라미터를 쌓지 않고도 에이전트·코드 능력을 크게 올릴 수 있다」를 보여주며 단순 규모 경쟁에서 아키텍처 효율 경쟁으로 이동합니다. 같은 주 OpenAI·Anthropic은 안전 평가에서 「탈옥」·실제 기업 시스템 무단 침입 사례를 연달아 공개했고, 8월 4일 백악관이 새 자율적 사이버보안 테스트 프레임 협의를 소집했습니다. 미·중 AI 내러티브가 같은 주 선명한 대비를 이룹니다.

FAQ 발췌:

  • Q: Qwen3.8-Max는 지금 바로 쓸 수 있나요? 오픈소스되었나요?A: API는 QwenCloud로 이용 가능합니다. 가중치는 미공개이고 8월 10일 전후 Hugging Face·ModelScope 저장소·라이선스 공표가 예상됩니다.
  • Q: Qwen3.8-Max와 Kimi K3 중 누가 더 강한가요?A: 권위 있는 단일 평가는 없습니다. 독립 맹평가에서는 동급·호각입니다. Kimi K3는 가중치·제3자 평가, Qwen3.8-Max는 API 가격·멀티모달이 강점입니다.
  • Q: 2.4조 파라미터면 일반 개발자는 쓸 수 없나요?A: 활성은 9500억만이고 API 비용은 천억급에 가깝습니다. 전체 온프레미스는 데이터센터급이 필요하고 Qwen3.8-27B 대기가 현실적입니다.
  • Q: Alibaba 공표 벤치마크를 믿을 수 있나요?A: 참고는 되지만 결론은 아닙니다. 독립 기관 추측정이나 자체 A/B 테스트를 권장합니다.
  • Q: 일반 사용자에게 실질 영향은?A: 중국판 Apple Intelligence 생성 AI가 Qwen 기반(압축 로컬 실행)이므로 국내 iPhone 사용자도 OS 레벨에서 Qwen 능력을 쓸 전망입니다.

아래는 집필 시점 공개 출처입니다. 상류가 갱신되면 원문을 따르세요.

https://qwen.ai

https://arena.ai

https://github.com/qwen-code-dev-bot/oh-my-cli

대안 구성의 실무적 단점: ① 16GB 노트북에서 2.4T 가중치 다운로드·로컬 추론을 시도하면 디스크·메모리가 즉시 포화되고 API fallback 라우팅으로는 하드웨어 한계를 넘을 수 없습니다. ② 덮으면 슬립·OAuth 만료로 장시간 Agent 배치(16일 자율 코딩 등)가 중단됩니다. Arena 상위 모델도 7×24 파이프라인은 노트북으로 돌릴 수 없습니다. ③ Qwen Agent 워크플로 검증용 고사양 Mac Studio를 사서 3개월 방치하면 주간 임대의 수배 감가상각이 발생합니다. 2.4T급 추론은 API가 맞고, 로컬에 필요한 것은 안정적인 macOS Agent 오케스트레이션 면만입니다.

전용 Apple Silicon, 7×24 상시 가동, 일/주/월 탄력 확장으로 macOS 호스트에서 Qwen3.8-Max API 기반 Agent(Qwen Code, OpenClaw, Claude Code 등)와 iOS CI를 함께 돌리려는 개발자·AI 자동화 팀에게 NOVAKVM Mac Mini 클라우드 베어메탈 임대가 일반적으로 더 나은 선택입니다. 6개 지역 노드, 고메모리 구성, SSH 직결로 Qwen API 추론과 베어메탈 macOS 실행면을 분리하여 다중 노드 클러스터 자체 구축과 노트북 슬립의 이중 함정을 피할 수 있습니다. NOVAKVM 요금 페이지에서 M4 Pro·스토리지 확장을 비교하고 주문 페이지에서 시험 머신을 시작하세요. 원격 접속은 고객 센터를 참고하세요.