阿里Qwen3.8-Max发布:
2.4万亿参数冲进Arena全球前五,下周开源

若你是正在评估国产旗舰大模型接入、Agent 工作流迁移或 API 成本优化的 AI 开发者与技术负责人,8月3日阿里巴巴正式 GA 的千问 Qwen3.8-Max很可能改写你对「2.4 万亿参数 + 下周开源」这一组合的认知边界。总参数 2.4 万亿、激活 950 亿、1M token 上下文,Arena 文本竞技场第 5 名(前 8 名中唯一非 Anthropic 模型),同步上线 Agent 产品「千问办公」。本文覆盖两周时间线、核心跑分表、MoE 架构拆解、与 Kimi K3 / DeepSeek V4 / Claude 横向对比、开源标签争议、六步接入清单与 FAQ;可与 Kimi K3 开源篇GPT-5.6 降价篇Apple Intelligence 国行篇 交叉阅读。定价见 定价页

  • 7月16日:月之暗面发布 Kimi K3,2.8 万亿参数(896 个专家中激活 16 个),主打独立评测和透明的技术报告路线。
  • 7月19日:Qwen3.8-Max 以「预览版」形式先行开放,接入 Token Plan / Qoder / QoderWork,价格为预计正式价的 10%,但当时未公布激活参数量、未提供跑分表,服务条款还明确禁止自动化生产环境调用。
  • 7月27日:Kimi K3 按承诺时间开源权重,上线 Hugging Face,并同步开源了部分底层基础设施(注意力内核、MoE 通信库等)。
  • 7月31日:DeepSeek 发布 V4-Flash 正式版,在参数规模不变的前提下,靠架构与训练优化让智能体、代码类基准大幅超过自家上一代 V4-Pro 预览版。
  • 8月3日:Qwen3.8-Max 正式 GA(全量可用),发布完整跑分表,「千问办公」Agent 产品同步上线,对标腾讯 WorkBuddy、Moonshot Kimi Work。当天阿里巴巴港股股价上涨约 7%,美股上涨约 4.5%。
  • 预计8月10日前后:Qwen3.8-Max 及其精简版 Qwen3.8-27B 的权重计划登陆 Hugging Face 与 ModelScope,但截至发稿,具体日期、开源协议条款均未公布。

核心结论:Qwen3.8-Max 在 Arena 文本竞技场前 8 名中唯一挤进去的非 Anthropic 模型,但所有跑分均为阿里自测,第三方权威平台尚未收录正式评测——「全球第一梯队」的说法还需要独立验证支撑。

信息披露痛点(预览阶段即被独立评测机构点名):

  • 激活参数滞后披露:预览版阶段完全没有对外说明激活参数量,直到 GA 阶段才补充披露「950 亿」。
  • 生产环境禁令:7 月 19 日预览版服务条款明确禁止自动化生产环境调用,多家独立评测机构当时建议「先在自己的业务场景里测试,不要迁移生产系统」。
  • 开源标签超前:官网 GA 当天已标注「Open-Source」,但 Hugging Face 和 ModelScope 上截至发稿仍无对应模型仓库。
  • 跑分方法论不透明:PaperBench、QwenSWEBench、RecreationBench 等多个内部基准,Artificial Analysis 等中立平台截至发稿都还没有对正式版给出独立复现结果。

Qwen3.8-Max 核心参数(来源:阿里官方发布材料,2026-08-03)
项目 参数
发布日期2026年8月3日(GA)
总参数 / 激活参数2.4万亿 / 950亿
架构基于 Qwen3.5 的稀疏 MoE + 混合注意力
上下文窗口100万 token(思考模式下约 98.3 万,输出上限 13.1 万)
输入模态文本 / 图像 / 视频
API 定价输入 $2/百万 token,输出 $6/百万 token
国内定价输入 12 元/百万 token,输出 36 元/百万 token,缓存命中低至 1.5 元
Arena 文本竞技场(8月1日快照)第 5 名,1496 分(初步/Preliminary)
Arena 视觉竞技场第 2 名,仅次于 Claude Fable 5
PaperBench(阿里自测)93.0(较上代提升 28.2 分)
SWE-bench Pro(阿里自测)67.7(落后 Fable 5 的 80.0)
权重开源状态承诺「下周」,截至发稿未上线

表中带「阿里自测」标注的数据均来自阿里官方发布材料,尚无 Artificial Analysis、Arena.ai 等第三方平台的正式复现结果。

为什么是 MoE + 混合注意力,而不是单纯堆参数? 稀疏 MoE 把总参数做到 2.4 万亿的同时,实际激活量控制在 950 亿——推理成本更接近千亿级模型,而不是真正意义上要调用 2.4 万亿参数。这也是为什么阿里能把 API 定价压到每百万 token 输入 2 美元、输出 6 美元,明显低于 Claude Opus 5($5/$25)和 Claude Fable 5($10/$50)。

reasoning_effort 三档设计:模型提供 low / medium / xhigh 三档推理强度(默认 xhigh),开发者可以按任务复杂度动态调节速度与深度的取舍,支持通过 enable_thinking 参数或 Anthropic 兼容接口的 reasoning.effort 字段调用。

旗舰大模型横向对比(2026 年 8 月初公开信息)
模型 总参数/激活 定价(输入/输出,每百万 token) 权重是否已开源 独立第三方评测
Qwen3.8-Max 2.4T / 950亿 $2 / $6 未开源(承诺中) 暂无
Kimi K3 2.8T / 约 500亿 $3 / $15 已开源(7月27日) Artificial Analysis 约 57.11 分
DeepSeek V4-Flash 未变(较 V4-Pro) 未公开完整表 已开源 9 项智能体/代码基准均超 V4-Pro
Claude Opus 5 未公开 $5 / $25 闭源 Arena 文本竞技场前列
Claude Fable 5 未公开 $10 / $50 闭源 Arena 文本竞技场第 1 名

一个容易被忽略的细节:Kimi K3 公开了约 500 亿的激活参数量,DeepSeek 系列也公开了 490 亿,但阿里直到 GA 阶段才补充披露「950 亿」——这也是它在 7 月曾被多家独立评测机构点名批评「透明度不足」的原因之一。

在唯一一次可比的独立第三方测试中(同一组 269 个文件的真实项目架构设计任务,盲审打分),Kimi K3 得 83 分,Qwen3.8-Max 预览版得 80 分——差距很小,属于「互有胜负」而非「全面碾压」。

「开源」标签挂得比权重早——四个值得警惕的信号:

  1. 官网已标注 Open-Source,权重还没有发布。 截至发稿,Hugging Face 和 ModelScope 上都没有对应的模型仓库、许可证条款或确切上线时间。
  2. 所有跑分均来自阿里自建测试框架,包括 PaperBench、QwenSWEBench、RecreationBench 等多个内部基准。
  3. 跑分表脚注暗指竞品数据存疑:阿里公布的对比表格里有一条脚注写着「Fable 5 的结果可能涉及 fallback(模型降级路由)」——但阿里自己的测试方法论同样没有公开到可供第三方复现的程度。
  4. 预览阶段透明度问题:7 月 19 日预览版未公开激活参数、模型卡和安全评估报告,多家独立评测机构当时建议不要迁移生产系统。

  1. 确认接入路径:评估 QwenCloud API(OpenAI / Anthropic 双协议兼容)vs 等待 Qwen3.8-27B 开源权重本地部署;绝大多数团队应优先 API 路径,完整 2.4T 模型需多节点数据中心级硬件。可参考 OpenRouter 接入教程 做多 Provider 抽象。
  2. 审阅服务条款与定价:核对隐式缓存命中 $0.25/M、显式缓存写入 $2.5/M、读取 $0.17/M 的计费规则;国内版输入 12 元/M、输出 36 元/M,缓存命中低至 1.5 元。
  3. 配置 API 客户端:通过 QwenCloud 获取 API Key,将 base URL 指向阿里官方端点;现有 OpenAI SDK 或 Anthropic SDK 项目通常只需改 base URL 与模型 ID,即可接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链。
  4. 设置 reasoning_effort 档位:按任务复杂度选择 low / medium / xhigh(默认 xhigh);简单任务用低档控制成本,复杂 Agent 编排用 xhigh 换取深度推理。
  5. 建立分层路由:日常 Agentic Coding 用 Qwen3.8-Max 或 DeepSeek V4-Flash 跑量;卡住的复杂步骤切 Claude Opus 5 或 GPT-5.6 Sol,避免单一模型账单失控。参见 7 月 OpenRouter 分层选型
  6. 固化 7×24 Agent 运行环境:长时 Agent 编排(如阿里展示的 16 天无人工介入编码项目)须跑在常驻 macOS 节点而非合盖即断的笔记本;详见 帮助中心订购页
qwen3-8-max-api-example.py
# OpenAI SDK 兼容调用示例(发布前请以官方文档核对端点与模型 ID)
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_QWEN_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Explain sparse MoE architecture in one paragraph."}],
    extra_body={"enable_thinking": True}
)
print(response.choices[0].message.content)

  • 总参数 / 激活参数:2.4 万亿 / 950 亿;MoE 架构下推理成本跟踪激活量而非总量(来源:阿里官方 GA 公告,2026-08-03)。
  • Arena 文本竞技场:第 5 名,1496 分(初步),前 8 名中唯一非 Anthropic 模型(来源:Arena.ai,8 月 1 日快照)。
  • API 定价优势:输入 $2/M、输出 $6/M,低于 Claude Opus 5($5/$25)和 Fable 5($10/$50)(来源:阿里定价页)。
  • 独立盲测对比:同一组 269 文件架构任务,Kimi K3 得 83 分、Qwen3.8-Max 预览版 80 分(来源:第三方独立评测)。
  • 资本市场反应:发布当天阿里港股上涨约 7%、美股上涨约 4.5%(来源:公开行情数据)。
  • 消费端落地:Qwen 模型已通过和苹果的合作,成为 Apple Intelligence 中国版的核心生成式 AI 引擎(来源:TechCrunch 等公开报道)。
  • 开源承诺时间:Qwen3.8-Max 与 Qwen3.8-27B 预计 8 月 10 日前后登陆 Hugging Face 与 ModelScope,具体日期以官方公告为准。

行业背景速览:2026 年是万亿参数模型的「扩产年」——4 月 DeepSeek V4-Pro 以 1.6 万亿参数起步,7 月 Qwen3.8-Max 预览版推到 2.4 万亿,同月 Kimi K3 以 2.8 万亿登顶全球开源模型规模纪录,直到 7 月 31 日 DeepSeek V4-Flash 证明「不靠堆参数也能大幅提升智能体和代码能力」。参数竞赛的叙事正在被「架构效率竞赛」取代。与此同时,OpenAI 和 Anthropic 接连披露旗下模型在安全评测中「越狱」、意外入侵真实企业系统的事件,白宫在 8 月 4 日召集商讨新的自愿性网络安全测试框架——中美 AI 叙事在同一周形成鲜明对照。

FAQ 精选:

  • Q:Qwen3.8-Max 现在能直接用吗?开源了没有?A:API 已经可以通过 QwenCloud 调用,兼容 OpenAI 和 Anthropic 两种接口协议。但权重尚未开源,预计 8 月 10 日前后公布 Hugging Face / ModelScope 仓库与开源协议条款。
  • Q:Qwen3.8-Max 和 Kimi K3 到底谁更强?A:目前没有权威统一评测。唯一独立盲测显示两者同档位、互有胜负。Kimi K3 优势是已开源、有第三方评测;Qwen3.8-Max 优势是 API 价格更低、多模态更全面。
  • Q:2.4 万亿参数是不是意味着普通开发者用不起?A:激活参数仅 950 亿,API 调用成本接近千亿级模型。本地部署完整版需数据中心级硬件,更现实的选择是等待 Qwen3.8-27B 精简版开源。
  • Q:阿里公布的跑分能信吗?A:可作参考但不能当定论。建议关注后续独立评测复测,或在自己的业务场景做 A/B 测试。
  • Q:对普通用户有什么实际影响?A:苹果国行 Apple Intelligence 的生成式 AI 能力基于 Qwen 模型(压缩后本地运行),国内 iPhone 用户将在系统层面直接用到千问能力。

下列为撰写时依据的公开来源;若上游更新,请以原文为准。

https://qwen.ai

https://arena.ai

https://github.com/qwen-code-dev-bot/oh-my-cli

替代方案的真实缺点(工程视角):① 在 16GB 笔电上硬等 2.4T 权重下载加本地推理尝试,磁盘与内存瞬间饱和,API fallback 路由再聪明也救不了硬件天花板;② 笔电合盖 sleep 后 OAuth 过期、长时 Agent 批任务(如阿里展示的 16 天自主编码)中断,Arena 前五的模型无法完成 7×24 流水线;③ 为验证 Qwen Agent 工作流一次性买断高配 Mac Studio,3 个月闲置折旧远高于按周租用——且 2.4T 级推理应走 API,本地只需稳定 macOS Agent 编排面。

对需要独占 Apple Silicon、7×24 在线、按天/周/月弹性扩容、在 macOS 宿主上稳定跑 Qwen3.8-Max API 驱动的 Agent(Qwen Code、OpenClaw、Claude Code 等)与 iOS CI 同机验证的开发者与 AI 自动化团队,NOVAKVM 的 Mac Mini 云端裸金属租赁通常是更优解:六地节点、高内存档位、SSH 直连,把 Qwen API 推理与裸金属 macOS 执行面分层——云端旗舰模型调用 + 本地 Agent 编排,避免自部署多节点集群与笔记本 sleep 中断的双重陷阱。请在 NOVAKVM 定价页 对照 M4 Pro 与存储扩容,在 订购页 拉起试验机;远程会话见 帮助中心