阿里 Qwen3.8-Max 發布:
2.4 兆參數衝進 Arena 全球前五,下週開源

若你是正在評估國產旗艦大模型接入、Agent 工作流遷移或 API 成本最佳化的 AI 開發者與技術負責人,8 月 3 日阿里巴巴正式 GA 的千問 Qwen3.8-Max,很可能改寫你對「2.4 兆參數+下週開源」這組合的認知邊界。總參數 2.4 兆、激活 950 億、1M token 上下文,Arena 文字競技場第 5 名(前 8 名中唯一非 Anthropic 模型),同步上線 Agent 產品「千問辦公」。本文涵蓋兩週時間軸、核心跑分表、MoE 架構拆解、與 Kimi K3/DeepSeek V4/Claude 橫向對照、開源標籤爭議、六步接入清單與 FAQ;可與 Kimi K3 開源篇GPT-5.6 降價篇Apple Intelligence 國行篇 交叉閱讀。定價見 定價頁

  • 7 月 16 日:月之暗面發布 Kimi K3,2.8 兆參數(896 個專家中激活 16 個),主打獨立評測與透明的技術報告路線。
  • 7 月 19 日:Qwen3.8-Max 以「預覽版」形式先行開放,接入 Token Plan/Qoder/QoderWork,價格為預計正式價的 10%,但當時未公布激活參數量、未提供跑分表,服務條款還明確禁止自動化生產環境呼叫。
  • 7 月 27 日:Kimi K3 按承諾時間釋出權重,上線 Hugging Face,並同步開源部分底層基礎設施(注意力核心、MoE 通訊函式庫等)。
  • 7 月 31 日:DeepSeek 發布 V4-Flash 正式版,在參數規模不變的前提下,靠架構與訓練最佳化讓智慧體、程式碼類基準大幅超過自家上一代 V4-Pro 預覽版。
  • 8 月 3 日:Qwen3.8-Max 正式 GA(全量可用),發布完整跑分表,「千問辦公」Agent 產品同步上線,對標騰訊 WorkBuddy、Moonshot Kimi Work。當天阿里巴巴港股股價上漲約 7%,美股上漲約 4.5%。
  • 預計 8 月 10 日前後:Qwen3.8-Max 及其精簡版 Qwen3.8-27B 的權重計畫登陸 Hugging Face 與 ModelScope,但截至發稿,具體日期、開源授權條款均未公布。

核心結論:Qwen3.8-Max 是 Arena 文字競技場前 8 名中唯一擠進去的非 Anthropic 模型,但所有跑分均為阿里自測,第三方權威平台尚未收錄正式評測——「全球第一梯隊」的說法還需要獨立驗證支撐。

資訊揭露痛點(預覽階段即被獨立評測機構點名):

  • 激活參數滯後揭露:預覽版階段完全沒有對外說明激活參數量,直到 GA 階段才補充揭露「950 億」。
  • 生產環境禁令:7 月 19 日預覽版服務條款明確禁止自動化生產環境呼叫,多家獨立評測機構當時建議「先在自己的業務場景裡測試,不要遷移生產系統」。
  • 開源標籤超前:官網 GA 當天已標註「Open-Source」,但 Hugging Face 與 ModelScope 上截至發稿仍無對應模型儲存庫。
  • 跑分方法論不透明:PaperBench、QwenSWEBench、RecreationBench 等多個內部基準,Artificial Analysis 等中立平台截至發稿都還沒有對正式版給出獨立覆核結果。

Qwen3.8-Max 核心參數(來源:阿里官方發布材料,2026-08-03)
項目 參數
發布日期2026 年 8 月 3 日(GA)
總參數/激活參數2.4 兆/950 億
架構基於 Qwen3.5 的稀疏 MoE+混合注意力
上下文視窗100 萬 token(思考模式下約 98.3 萬,輸出上限 13.1 萬)
輸入模態文字/影像/影片
API 定價輸入 $2/百萬 token,輸出 $6/百萬 token
中國大陸定價輸入 12 元/百萬 token,輸出 36 元/百萬 token,快取命中低至 1.5 元
Arena 文字競技場(8 月 1 日快照)第 5 名,1496 分(初步/Preliminary)
Arena 視覺競技場第 2 名,僅次於 Claude Fable 5
PaperBench(阿里自測)93.0(較上代提升 28.2 分)
SWE-bench Pro(阿里自測)67.7(落後 Fable 5 的 80.0)
權重開源狀態承諾「下週」,截至發稿未上線

表中帶「阿里自測」標註的資料均來自阿里官方發布材料,尚無 Artificial Analysis、Arena.ai 等第三方平台的正式覆核結果。

為什麼是 MoE+混合注意力,而不是單純堆參數? 稀疏 MoE 把總參數做到 2.4 兆的同時,實際激活量控制在 950 億——推理成本更接近千億級模型,而不是真正意義上要呼叫 2.4 兆參數。這也是阿里能把 API 定價壓到每百萬 token 輸入 2 美元、輸出 6 美元,明顯低於 Claude Opus 5($5/$25)和 Claude Fable 5($10/$50)。

reasoning_effort 三檔設計:模型提供 low/medium/xhigh 三檔推理強度(預設 xhigh),開發者可按任務複雜度動態調節速度與深度的取捨,支援透過 enable_thinking 參數或 Anthropic 相容介面的 reasoning.effort 欄位呼叫。

旗艦大模型橫向對照(2026 年 8 月初公開資訊)
模型 總參數/激活 定價(輸入/輸出,每百萬 token) 權重是否已開源 獨立第三方評測
Qwen3.8-Max 2.4T/950 億 $2/$6 未開源(承諾中) 暫無
Kimi K3 2.8T/約 500 億 $3/$15 已開源(7 月 27 日) Artificial Analysis 約 57.11 分
DeepSeek V4-Flash 未變(較 V4-Pro) 未公開完整表 已開源 9 項智慧體/程式碼基準均超 V4-Pro
Claude Opus 5 未公開 $5/$25 閉源 Arena 文字競技場前列
Claude Fable 5 未公開 $10/$50 閉源 Arena 文字競技場第 1 名

一個容易被忽略的細節:Kimi K3 公開了約 500 億的激活參數量,DeepSeek 系列也公開了 490 億,但阿里直到 GA 階段才補充揭露「950 億」——這也是它在 7 月曾被多家獨立評測機構點名批評「透明度不足」的原因之一。

在唯一一次可比的獨立第三方測試中(同一組 269 個檔案的真實專案架構設計任務,盲審打分),Kimi K3 得 83 分,Qwen3.8-Max 預覽版得 80 分——差距很小,屬於「互有勝負」而非「全面碾壓」。

「開源」標籤掛得比權重早——四個值得警惕的訊號:

  1. 官網已標註 Open-Source,權重還沒有發布。 截至發稿,Hugging Face 與 ModelScope 上都沒有對應的模型儲存庫、授權條款或確切上線時間。
  2. 所有跑分均來自阿里自建測試框架,包括 PaperBench、QwenSWEBench、RecreationBench 等多個內部基準。
  3. 跑分表腳註暗指競品資料存疑:阿里公布的對照表格裡有一條腳註寫著「Fable 5 的結果可能涉及 fallback(模型降級路由)」——但阿里自己的測試方法論同樣沒有公開到可供第三方覆核的程度。
  4. 預覽階段透明度問題:7 月 19 日預覽版未公開激活參數、模型卡和安全評估報告,多家獨立評測機構當時建議不要遷移生產系統。

  1. 確認接入路徑:評估 QwenCloud API(OpenAI/Anthropic 雙協定相容)vs 等待 Qwen3.8-27B 開源權重本地部署;絕大多數團隊應優先 API 路徑,完整 2.4T 模型需多節點資料中心級硬體。可參考 OpenRouter 接入教學 做多 Provider 抽象。
  2. 審閱服務條款與定價:核對隱式快取命中 $0.25/M、顯式快取寫入 $2.5/M、讀取 $0.17/M 的計費規則;中國大陸版輸入 12 元/M、輸出 36 元/M,快取命中低至 1.5 元。
  3. 設定 API 用戶端:透過 QwenCloud 取得 API Key,將 base URL 指向阿里官方端點;現有 OpenAI SDK 或 Anthropic SDK 專案通常只需改 base URL 與模型 ID,即可接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈。
  4. 設定 reasoning_effort 檔位:按任務複雜度選擇 low/medium/xhigh(預設 xhigh);簡單任務用低檔控制成本,複雜 Agent 編排用 xhigh 換取深度推理。
  5. 建立分層路由:日常 Agentic Coding 用 Qwen3.8-Max 或 DeepSeek V4-Flash 跑量;卡住的複雜步驟切 Claude Opus 5 或 GPT-5.6 Sol,避免單一模型帳單失控。參見 7 月 OpenRouter 分層選型
  6. 固化 7×24 Agent 執行環境:長時 Agent 編排(如阿里展示的 16 天無人工介入編碼專案)須跑在常駐 macOS 節點而非合蓋即斷的筆電;詳見 說明中心訂購頁
qwen3-8-max-api-example.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_QWEN_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Explain sparse MoE architecture in one paragraph."}],
    extra_body={"enable_thinking": True}
)
print(response.choices[0].message.content)

  • 總參數/激活參數:2.4 兆/950 億;MoE 架構下推理成本跟蹤激活量而非總量(來源:阿里官方 GA 公告,2026-08-03)。
  • Arena 文字競技場:第 5 名,1496 分(初步),前 8 名中唯一非 Anthropic 模型(來源:Arena.ai,8 月 1 日快照)。
  • API 定價優勢:輸入 $2/M、輸出 $6/M,低於 Claude Opus 5($5/$25)和 Fable 5($10/$50)(來源:阿里定價頁)。
  • 獨立盲測對照:同一組 269 檔案架構任務,Kimi K3 得 83 分、Qwen3.8-Max 預覽版 80 分(來源:第三方獨立評測)。
  • 資本市場反應:發布當天阿里港股上漲約 7%、美股上漲約 4.5%(來源:公開行情資料)。
  • 消費端落地:Qwen 模型已透過與蘋果的合作,成為 Apple Intelligence 中國版的核心生成式 AI 引擎(來源:TechCrunch 等公開報導)。
  • 開源承諾時間:Qwen3.8-Max 與 Qwen3.8-27B 預計 8 月 10 日前後登陸 Hugging Face 與 ModelScope,具體日期以官方公告為準。

產業背景速覽:2026 年是兆級參數模型的「擴產年」——4 月 DeepSeek V4-Pro 以 1.6 兆參數起步,7 月 Qwen3.8-Max 預覽版推到 2.4 兆,同月 Kimi K3 以 2.8 兆登頂全球開源模型規模紀錄,直到 7 月 31 日 DeepSeek V4-Flash 證明「不靠堆參數也能大幅提升智慧體與程式碼能力」。參數競賽的敘事正在被「架構效率競賽」取代。與此同時,OpenAI 與 Anthropic 接連揭露旗下模型在安全評測中「越獄」、意外入侵真實企業系統的事件,白宮在 8 月 4 日召集商討新的自願性網路安全測試框架——中美 AI 敘事在同一週形成鮮明對照。

FAQ 精選:

  • Q:Qwen3.8-Max 現在能直接用嗎?開源了沒有?A:API 已可透過 QwenCloud 呼叫,相容 OpenAI 與 Anthropic 兩種介面協定。但權重尚未釋出,預計 8 月 10 日前後公布 Hugging Face/ModelScope 儲存庫與開源授權條款。
  • Q:Qwen3.8-Max 和 Kimi K3 到底誰更強?A:目前沒有權威統一評測。唯一獨立盲測顯示兩者同檔位、互有勝負。Kimi K3 優勢是已開源、有第三方評測;Qwen3.8-Max 優勢是 API 價格更低、多模態更全面。
  • Q:2.4 兆參數是不是代表一般開發者用不起?A:激活參數僅 950 億,API 呼叫成本接近千億級模型。本地部署完整版需資料中心級硬體,更現實的選擇是等待 Qwen3.8-27B 精簡版開源。
  • Q:阿里公布的跑分能信嗎?A:可作參考但不能當定論。建議關注後續獨立評測複測,或在自己的業務場景做 A/B 測試。
  • Q:對一般使用者有什麼實際影響?A:蘋果國行 Apple Intelligence 的生成式 AI 能力基於 Qwen 模型(壓縮後本地執行),國行 iPhone 使用者將在系統層面直接用到千問能力。

下列為撰寫時依據的公開來源;若上游更新,請以原文為準。

https://qwen.ai

https://arena.ai

https://github.com/qwen-code-dev-bot/oh-my-cli

替代方案的真實缺點(工程視角):① 在 16GB 筆電上硬等 2.4T 權重下載加本地推理嘗試,磁碟與記憶體瞬間飽和,API fallback 路由再聰明也救不了硬體天花板;② 筆電合蓋 sleep 後 OAuth 過期、長時 Agent 批次任務(如阿里展示的 16 天自主編碼)中斷,Arena 前五的模型無法完成 7×24 流水線;③ 為驗證 Qwen Agent 工作流一次性買斷高配 Mac Studio,3 個月閒置折舊遠高於按週租用——且 2.4T 級推理應走 API,本地只需穩定 macOS Agent 編排面。

對需要獨佔 Apple Silicon、7×24 線上、按天/週/月彈性擴容、在 macOS 宿主上穩定跑 Qwen3.8-Max API 驅動的 Agent(Qwen Code、OpenClaw、Claude Code 等)與 iOS CI 同機驗證的開發者與 AI 自動化團隊,NOVAKVM 的 Mac Mini 雲端裸機租賃通常是更優解:六地節點、高記憶體檔位、SSH 直連,把 Qwen API 推理與裸機 macOS 執行面分層——雲端旗艦模型呼叫+本地 Agent 編排,避免自部署多節點叢集與筆電 sleep 中斷的雙重陷阱。請在 NOVAKVM 定價頁 對照 M4 Pro 與儲存擴容,在 訂購頁 拉起試驗機;遠端連線見 說明中心