国産 flagship 大規模モデルの導入、Agent ワークフロー移行、API コスト最適化を検討する AI 開発者と技術責任者にとって、8 月 3 日 Alibaba が正式 GA した千問 Qwen3.8-Maxは、「2.4 兆パラメータ+来週オープンソース」という組み合わせの認識を更新する出来事です。総パラメータ 2.4 兆、活性 950 億、100 万 token コンテキスト、Arena テキスト競技場 5 位(上位 8 モデル中唯一の非 Anthropic モデル)、Agent 製品「千問オフィス」も同時投入されました。本稿では二週間のタイムライン、コアベンチマーク表、MoE アーキテクチャ分解、Kimi K3 / DeepSeek V4 / Claude との横断比較、オープンソースラベル論争、六ステップ導入チェックリストと FAQを整理します。Kimi K3 重み公開編、GPT-5.6 値下げ編、Apple Intelligence 中国版編と併読してください。料金は 料金ページをご覧ください。
[ SECTION_01 ] // TIMELINE プレビューから正式版まで:二週間で国産大規模モデルのペースはどれほど速いか
- 7 月 16 日:Moonshot AI が Kimi K3 を公開。総パラメータ 2.8 兆(896 エキスパート中 16 活性)、独立評価と透明な技術報告路線を打ち出しました。
- 7 月 19 日:Qwen3.8-Max が「プレビュー版」として先行公開。Token Plan / Qoder / QoderWork に接続、正式価格の 10% で提供されましたが、活性パラメータとベンチマーク表は未公表、利用規約は自動化生産環境の呼び出しを明示的に禁止していました。
- 7 月 27 日:Kimi K3 が約束どおり重みを公開し Hugging Face に登場。アテンションカーネルや MoE 通信ライブラリなど一部 Infra も同時オープンしました。
- 7 月 31 日:DeepSeek が V4-Flash 正式版を発表。パラメータ規模を変えず、アーキテクチャと学習最適化でエージェント・コード系ベンチマークを自社 V4-Pro プレビュー版を大きく上回りました。
- 8 月 3 日:Qwen3.8-Max が正式 GA(全量利用可能)。完全ベンチマーク表を公開し、Agent 製品「千問オフィス」も Tencent WorkBuddy、Moonshot Kimi Work に対抗する形で同時ローンチ。当日 Alibaba 株は香港で約 7%、米国で約 4.5% 上昇しました。
- 8 月 10 日前後(予定):Qwen3.8-Max と軽量版 Qwen3.8-27B の重みが Hugging Face と ModelScope に登場する計画ですが、執筆時点では具体的な日付とライセンス条項は未公表です。
結論:Qwen3.8-Max は Arena テキスト競技場上位 8 モデル中、唯一非 Anthropic として入ったモデルです。ただしベンチマークはすべて Alibaba 自測で、第三者権威機関による正式評価は未収録です。「世界第一梯隊」の評価には独立検証が必要です。
情報開示の痛点(プレビュー段階から独立評価機関が指摘):
- 活性パラメータの遅延開示:プレビュー期間中は活性パラメータが一切公表されず、GA 段階で初めて「950 億」が追加されました。
- 生産環境禁止:7 月 19 日プレビュー版の利用規約は自動化生産環境の呼び出しを明示禁止し、複数の独立機関が「自社業務で試験し、生産系は移行しない」と勧告していました。
- オープンソースラベルの先行:公式サイトは GA 当日から「Open-Source」と表示していますが、執筆時点で Hugging Face と ModelScope に対応リポジトリはありません。
- ベンチマーク手法の不透明性:PaperBench、QwenSWEBench、RecreationBench など内部ベンチマークについて、Artificial Analysis 等の中立機関は正式版の独立再測をまだ公表していません。
[ SECTION_02 ] // SPECS Qwen3.8-Max コアデータ一覧:2.4T パラメータが意味すること
| 項目 | 値 |
|---|---|
| リリース日 | 2026 年 8 月 3 日(GA) |
| 総パラメータ / 活性パラメータ | 2.4 兆 / 950 億 |
| アーキテクチャ | Qwen3.5 ベースのsparse MoE + ハイブリッドアテンション |
| コンテキストウィンドウ | 100 万 token(思考モードで約 98.3 万、出力上限 13.1 万) |
| 入力モダリティ | テキスト / 画像 / 動画 |
| API 料金 | 入力 $2/百万 token、出力 $6/百万 token |
| 国内料金 | 入力 12 元/百万 token、出力 36 元/百万 token、キャッシュヒット最低 1.5 元 |
| Arena テキスト競技場(8 月 1 日スナップショット) | 5 位、1496 点(Preliminary) |
| Arena ビジュアル競技場 | 2 位、Claude Fable 5 に次ぐ |
| PaperBench(Alibaba 自測) | 93.0(前世代比 +28.2 点) |
| SWE-bench Pro(Alibaba 自測) | 67.7(Fable 5 の 80.0 に劣る) |
| 重み公開状況 | 「来週」と約束、執筆時点未公開 |
表の「Alibaba 自測」表記データはすべて Alibaba 公式資料由来で、Artificial Analysis や Arena.ai による第三者の正式再測はまだありません。
なぜ MoE + ハイブリッドアテンションで、単純なパラメータ積み上げではないのか:sparse MoE により総パラメータ 2.4 兆を実現しつつ、実際の活性量は 950 億に抑制しています。推論コストは千億級モデルに近く、2.4 兆を丸ごと呼び出すわけではありません。これが API 料金を入力 $2/M・出力 $6/M に抑え、Claude Opus 5($5/$25)や Claude Fable 5($10/$50)を下回る理由です。
reasoning_effort 三段階設計:low / medium / xhigh の三段階(デフォルト xhigh)で推論深度と速度のトレードオフを調整できます。enable_thinking パラメータ、または Anthropic 互換インターフェースの reasoning.effort フィールドで呼び出します。
[ SECTION_03 ] // COMPARE Qwen3.8-Max vs Kimi K3 vs DeepSeek V4:どれを接続すべきか
| モデル | 総/活性パラメータ | 料金(入力/出力、百万 token あたり) | 重み公開 | 独立第三者評価 |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950 億 | $2 / $6 | 未公開(約束中) | なし |
| Kimi K3 | 2.8T / 約 500 億 | $3 / $15 | 公開済み(7 月 27 日) | Artificial Analysis 約 57.11 点 |
| DeepSeek V4-Flash | 不変(V4-Pro 比) | 完全表未公表 | 公開済み | 9 項のエージェント/コードベンチで V4-Pro 超え |
| Claude Opus 5 | 非公開 | $5 / $25 | クローズド | Arena テキスト上位 |
| Claude Fable 5 | 非公開 | $10 / $50 | クローズド | Arena テキスト 1 位 |
見落とされがちな点:Kimi K3 は活性パラメータ約 500 億を公開し、DeepSeek 系列も 490 億を公表しています。Alibaba は GA 段階で初めて「950 億」を開示しました。7 月に複数の独立機関が「透明性不足」と指摘した背景の一つです。
唯一の独立盲測(同一 269 ファイルの実プロジェクトアーキテクチャ設計タスク、盲審採点)では Kimi K3 が 83 点、Qwen3.8-Max プレビュー版が 80 点で、差は小さく「互角」に近い結果です。
「オープンソース」ラベルが重みより先に付いた——四つの警戒信号:
- 公式は Open-Source 表示、重みは未公開。執筆時点で Hugging Face と ModelScope にリポジトリ、ライセンス、確定日程はありません。
- ベンチマークはすべて Alibaba 自社フレームワーク由来で、PaperBench、QwenSWEBench、RecreationBench など内部基準を含みます。
- 比較表脚注が競合データを疑う:Alibaba 公表表の脚注に「Fable 5 の結果は fallback(モデル降格ルーティング)の可能性」とありますが、Alibaba 側のテスト手法も第三者再現可能な水準まで公開されていません。
- プレビュー期の透明性問題:7 月 19 日プレビューは活性パラメータ、モデルカード、安全評価報告を未公開で、複数機関が生産移行を勧告していました。
[ SECTION_04 ] // DEPLOY Qwen3.8-Max 六ステップ導入チェックリスト:API 試験から Agent 本番まで
- 接続経路を確定:QwenCloud API(OpenAI / Anthropic 双プロトコル)か Qwen3.8-27B 重み公開後のローカルデプロイかを評価します。大多数のチームは API が正解で、フル 2.4T は多ノードのデータセンター級ハードが必要です。OpenRouter 導入ガイドでマルチプロバイダ抽象化を検討してください。
- 利用規約と料金を精読:暗黙キャッシュヒット $0.25/M、明示キャッシュ書き込み $2.5/M、読み取り $0.17/M の課金ルールを確認します。国内版は入力 12 元/M、出力 36 元/M、キャッシュヒット最低 1.5 元です。
- API クライアントを設定:QwenCloud で API Key を取得し、base URL を Alibaba 公式エンドポイントに向けます。既存 OpenAI SDK や Anthropic SDK プロジェクトは base URL とモデル ID の変更で、Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw など主要 Agent ツールに接続できます。
- reasoning_effort 段階を設定:タスク難度に応じ low / medium / xhigh(デフォルト xhigh)を選択します。単純タスクは低段階でコスト抑制、複雑な Agent オーケストレーションは xhigh で深度を優先します。
- 階層ルーティングを構築:日常の Agentic Coding は Qwen3.8-Max や DeepSeek V4-Flash で処理し、難所は Claude Opus 5 や GPT-5.6 Sol にエスカレートします。単一モデル課金の暴走を防ぎます。7 月 OpenRouter 階層選定を参照してください。
- 7×24 Agent 実行環境を固定:長時間 Agent オーケストレーション(Alibaba が示した 16 日間無人介入コーディングプロジェクトなど)は、蓋を閉じるとスリープするノート PCではなく常時稼働 macOS ノードが必要です。ヘルプセンターと 注文ページをご覧ください。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_QWEN_API_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Explain sparse MoE architecture in one paragraph."}],
extra_body={"enable_thinking": True}
)
print(response.choices[0].message.content)
[ SECTION_05 ] // FACTS_FAQ 引用可能データ、業界背景、FAQ、7×24 Agent ホストへの収束
- 総パラメータ / 活性パラメータ:2.4 兆 / 950 億。MoE では推論コストは活性量に追従(出典:Alibaba GA 公告、2026-08-03)。
- Arena テキスト競技場:5 位、1496 点(Preliminary)。上位 8 中唯一の非 Anthropic(出典:Arena.ai、8 月 1 日スナップショット)。
- API 料金優位:入力 $2/M、出力 $6/M。Claude Opus 5($5/$25)と Fable 5($10/$50)を下回る(出典:Alibaba 料金ページ)。
- 独立盲測比較:同一 269 ファイルのアーキテクチャタスクで Kimi K3 83 点、Qwen3.8-Max プレビュー 80 点(出典:第三者独立評価)。
- 資本市場反応:発表当日 Alibaba 株は香港約 7%、米国約 4.5% 上昇(出典:公開相場データ)。
- 消費者向け展開:Qwen は Apple との提携により、中国版 Apple Intelligence の生成 AI 中核(圧縮後ローカル実行)として採用(出典:TechCrunch 等)。
- 重み公開予定:Qwen3.8-Max と Qwen3.8-27B は 8 月 10 日前後に Hugging Face と ModelScope へ、確定日は公式待ち。
業界背景:2026 年は兆級パラメータモデルの「拡産年」です。4 月 DeepSeek V4-Pro が 1.6 兆で始まり、7 月 Qwen3.8-Max プレビューが 2.4 兆、同月 Kimi K3 が 2.8 兆で世界 open weight 規模記録を更新しました。7 月 31 日の DeepSeek V4-Flash は「パラメータを積まずにエージェント・コード能力を大幅向上」できることを示し、単純な規模競争からアーキテクチャ効率競争へシフトしています。同週、OpenAI と Anthropic は安全評価で「脱獄」や実企業システムへの意図しない侵入事例を相次ぎ公表し、8 月 4 日にはホワイトハウスが新たな自主的サイバーセキュリティテスト枠組みの協議を招集しました。米中の AI ナラティブが同週に鮮明な対比を呈しています。
FAQ 抜粋:
- Q:Qwen3.8-Max は今すぐ使えますか?オープンソース済みですか?A:API は QwenCloud で利用可能です。重みは未公開で、8 月 10 日前後に Hugging Face / ModelScope リポジトリとライセンスが公表される見込みです。
- Q:Qwen3.8-Max と Kimi K3 はどちらが強いですか?A:権威ある統一評価はありません。独立盲測では同格・互角です。Kimi K3 は重み公開と第三者評価、Qwen3.8-Max は API 価格とマルチモーダルが強みです。
- Q:2.4 兆パラメータは一般開発者には手が届きませんか?A:活性は 950 億のみで、API コストは千億級に近いです。フル版オンプレミスはデータセンター級が必要で、Qwen3.8-27B の待機が現実的です。
- Q:Alibaba 公表のベンチマークは信頼できますか?A:参考にはなりますが結論には使えません。独立機関の追試か自社 A/B テストを推奨します。
- Q:一般ユーザーへの実影響は?A:中国版 Apple Intelligence の生成 AI が Qwen ベース(圧縮ローカル実行)のため、国内 iPhone ユーザーは OS レベルで千問能力を利用する見込みです。
以下は執筆時点の公開ソースです。上流が更新された場合は原文を正としてください。
https://github.com/qwen-code-dev-bot/oh-my-cli
代替構成の実務上の欠点:① 16GB ノート PC で 2.4T 重みのダウンロードとローカル推論を試すと、ディスクとメモリが即座に飽和し、API fallback ルーティングではハード上限は超えられません。② 蓋を閉じるとスリープし OAuth が切れ、長時間 Agent バッチ(16 日間自律コーディングなど)が中断します。Arena 上位モデルでも 7×24 パイプラインはノートでは回せません。③ Qwen Agent ワークフロー検証のために高配 Mac Studio を買い、3 か月放置すると週次レンタルの数倍の減価償却が発生します。2.4T 級推論は API 経由が正しく、ローカルに必要なのは安定した macOS Agent オーケストレーション面だけです。
専有 Apple Silicon、7×24 常時稼働、日/週/月の弾力スケールで、macOS ホスト上に Qwen3.8-Max API 駆動の Agent(Qwen Code、OpenClaw、Claude Code 等)と iOS CI を同居させたい開発者と AI 自動化チームには、NOVAKVM の Mac Mini クラウドベアメタルレンタルが通常はより適した選択です。六地域ノード、高メモリ構成、SSH 直結で、Qwen API 推論と裸金属 macOS 実行面を分離し、多ノードクラスタ自前構築とノート PC スリープの二重の罠を避けられます。NOVAKVM 料金ページで M4 Pro とストレージ拡張を比較し、注文ページで試験機を起動してください。リモート接続は ヘルプセンターをご参照ください。