AI 開発者、技術選定担当、オープンソース LLM を追うエンジニア向けに、2026 年 7 月 16 日深夜、Moonshot AI(月之暗面)が API ドキュメント上部に「Kimi K3 提供開始」のバナーを静かに掲げました。大規模キーノートはなく、2.8 兆(2.8T)パラメータという現時点で世界最大のオープンソース AI モデルがそのまま呼び出し可能になったのです。本記事ではMoE 896 エキスパート/16 アクティブ、100 万 token コンテキストとネイティブビジョン、KDA/AttnRes/Stable LatentMoE の 3 大アーキテクチャ革新、Claude Fable 5/GPT-5.6 Sol とのベンチマーク全表、$3/$15 および国内 ¥20/¥100 料金、4 つの即時接続方法、7 月 27 日 Hugging Face 重み公開、6 項目の FAQをまとめます。ノード料金は料金ページをご覧ください。
[ SECTION_01 ] // OVERVIEW Kimi K3 とは?2.8T の静かな公開とコア仕様
Kimi K3 は世界最大規模のオープンソース AI モデルです。2.8T パラメータは、従来記録保持者 DeepSeek V4 Pro(1.6T)を約 75% 上回り、Xiaomi のオープンモデル(1.02T)の 2.7 倍、Alibaba(397B)の 7 倍以上です。スパース MoE アーキテクチャで、推論時に 896 エキスパートから 16 個をアクティブ化します。100 万 token の超長コンテキスト(『紅楼夢』全 5 冊相当を一度に読み込める規模)とネイティブな画像・動画理解を備え、複雑なコーディング、長文推論、ナレッジワーク向けに設計されています。
要約すると、Kimi K3 は画像・動画をネイティブ理解し、超長記憶を持つオープンソースの「重量級コーディング AI」です。Claude Opus 4.8 より約 40% 安く、7 月 27 日に完全な重みが公開される予定です。
導入前に押さえるべき 3 つの痛点は次のとおりです。
- ローカルデプロイの壁:2.8T は本番セルフホストに 64 枚以上のアクセラレータを要するスーパーノード規模です。重み公開は「ノート PC で動く」ことを意味しません。
- ベンチマークの独立検証待ち:Moonshot 自報値は Kimi Code、Codex、Claude Code などハーネスが異なります。第三者再現は進行中で、単一表だけで調達判断すべきではありません。
- 全シナリオ最強ではない:FrontierSWE や Terminal Bench 2.1 では Claude Fable 5 や GPT-5.6 Sol が先行しています。「最大パラメータ」一択ではなくタスク行列で選ぶ必要があります。
| 項目 | Kimi K3 |
|---|---|
| 総パラメータ数 | 2.8 兆(2.8T) |
| アーキテクチャ | KDA + AttnRes + Stable LatentMoE |
| MoE スパース度 | 896 エキスパート、毎回 16 個アクティブ(1.8%) |
| コンテキストウィンドウ | 1,048,576 token(1M) |
| 入力モダリティ | テキスト、画像、動画 |
| API モデル ID | kimi-k3 |
| オープン重み | 2026 年 7 月 27 日 Hugging Face |
静かな公開と 2.8T のスケールは対照的です。パラメータ競争の見せかけではなく、商用化フェーズにおける技術的主権の表明と読めます。
[ SECTION_02 ] // ARCHITECTURE DeepSeek 衝撃後の反撃:ビジネス背景と 3 大革新
月之暗面は過去 18 か月、DeepSeek の台頭でシェアを大きく失いました。K3 の公開は見事な反撃であり、2026 世界人工知能大会(WAIC)前夜というタイミングも戦略的です。
- 過去 12 か月のうち 9 か月、Kimi 系列がオープンソース最大規模を保持;
- 2026 年 6 月時点で ARR(年間経常収益)は 3 億米ドルを突破;
- 年内に 第 6 ラウンド資金調達、投前評価額 315 億米ドル;
- API 収入が全体の 7 割超、海外有料ユーザー 400% 成長。
Kimi Delta Attention(KDA)—— 注意機構の再設計
従来の Transformer 全注意は長コンテキストで計算量が二乗に増え、100 万 token では KV キャッシュのメモリ消費が致命的です。KDA は混合線形注意機構です。
- 3:1で線形注意層と全注意層を交互配置——3 層が局所、1 層がグローバル情報を保持;
- KV キャッシュメモリを最大 75% 削減;
- 100 万 token コンテキストでデコード速度が最大 6.3 倍;
- 短・長コンテキストおよび RL 拡張の各シナリオで純全注意ベースラインを上回ります。
Attention Residuals(AttnRes)—— 深度方向の情報損失対策
- 標準残差接続は深度に沿って情報を均一に蓄積し、浅層の重要表現が希薄化;
- AttnRes は選択的取得により、より浅い層の高価値表現を直接引き出せます;
- Moonshot 報告では約 25% の学習効率向上、追加計算コストは 2% 未満。
Stable LatentMoE —— 超高スパースの安定学習
Kimi K3 は 896 エキスパートから 16 個を推論時にアクティブ化し、スパース度 1.8% です。Quantile Balancing、Per-Head Muon、Sigmoid Tanh Unit(SiTU)、Gated MLA を組み合わせ、Kimi K2 比で全体のスケーリング効率が約 2.5 倍向上したと報告されています。
| 技術 | 役割 |
|---|---|
| Quantile Balancing | ルータースコアの分位点からエキスパート割当を直接導出、ヒューリスティック超パラを排除 |
| Per-Head Muon | 各注意ヘッドを独立最適化し、大規模学習を適応的に |
| SiTU | 活性化関数の制御を改善 |
| Gated MLA | 注意の選択性を向上 |
[ SECTION_03 ] // BENCHMARKS ベンチマーク全表:K3 の強みと料金比較
Moonshot 自報のコアベンチマーク(GLM-5.2 対照含む)は以下のとおりです。
| ベンチマーク | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 12.9 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 91.2 |
| MMMU-Pro(ビジョン) | 81.6 | 81.2 | 83.0 | 78.9 | — |
| OmniDocBench(文書理解) | 91.1 | 89.8 | 85.8 | 87.9 | — |
要点:長時間コーディング(SWE Marathon)で K3 は 42.0 と大差リード。Program Bench も 77.8 で首位。FrontierSWE は Fable 5 が 86.6 で先行。OmniDocBench 91.1 はビジョン + 長コンテキストの相乗効果を示します。Artificial Analysis Intelligence Index v4.1 では K3 は 57.1 点で世界 4 位、Claude Fable 5(59.9)と GPT-5.6 Sol(58.9)に続き、1 位との差は 2.8 点のみです。
注意:上記は Moonshot 自報値です。モデルごとに推論ハーネスが異なり(K3 は Kimi Code、GPT は Codex、Claude は Claude Code)、独立再現は進行中です。方向性の参考として扱い、最終判断にはしないでください。
| モデル | 入力 | 出力 | キャッシュヒット入力 | コンテキスト |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00(プロモ $2) | $15.00(プロモ $10) | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
K3 の標準料金は Claude Sonnet 5 と同じ $3/$15 ですが、5 倍のコンテキストを提供します。キャッシュヒットは $0.30/M(標準の 1/10)で、Moonshot はコーディング用途でキャッシュヒット率 90% 超を報告しています。国内 API:¥20/M(入力)、¥100/M(出力)、キャッシュヒット ¥2/M。kimi.com の無料アカウントで利用可能、プリペイド ¥199 から(8 月 11 日までの優待)。
[ SECTION_04 ] // ACCESS 4 つの接続方法、6 ステップ導入、シナリオ選定
Kimi K3 は次の 4 方法ですぐに呼び出せます。
- 方法 1 — Kimi Web/App:kimi.com でアカウント登録(Google 連携可)。K3 は最大推論モードで動作、クレジットカード不要。
- 方法 2 — 公式 API:platform.kimi.ai で API Key を取得。モデル ID は
kimi-k3、OpenAI 互換。 - 方法 3 — OpenRouter:モデル ID
moonshotai/kimi-k3。Moonshot 公式料金、マークアップなし、1M コンテキスト完全対応。 - 方法 4 — 7 月 27 日のオープン重み待ち:Hugging Face で完全重み公開。本番デプロイには 64 枚以上のアクセラレータが必要。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "このコードを分析してください..."}]
)
- タスク境界の明確化:上記ベンチマーク表で、SWE Marathon 型長コード、Repo 級バグ修正、ターミナル Agent、文書マルチモーダルのどれに該当するか確認します。
- kimi.com で登録・検証:Google アカウントで登録し、Web で典型 Prompt を試し、ビジョンと長コンテキストを確認します。
- Moonshot API Key 申請:platform.kimi.ai で Key を作成し用量アラートを設定。国内ユーザーは ¥20/¥100/¥2 と ¥199 プリペイドを確認します。
- OpenAI 互換 SDK 接続:
base_urlをhttps://api.moonshot.ai/v1、モデル ID をkimi-k3に固定。OpenRouter 利用時はmoonshotai/kimi-k3に切替えます。 - キャッシュ戦略の有効化:コーディングワークフローは繰返しコンテキストが多く、ヒット率 90% 超——Mooncake 分推論アーキテクチャに沿った Prompt 設計で実効入力コストを約 $0.55/M まで下げます。
- 検証環境の固定:Xcode ビルド、Fastlane、マルチモデル Agent ルーティングを7×24 安定 Apple Silicon ホストへ移し、API 試行と iOS CI/CD を同一マシンで検証します。K3 セルフホストは 7 月 27 日以降で 64+ GPU が必要——iOS リリースのペースをローカル推論クラスタに賭けるべきではありません。NOVAKVM 案は下文参照。
| シナリオ | 推奨モデル | 理由 |
|---|---|---|
| 持続的長コードタスク(SWE Marathon 型) | Kimi K3 | ベンチ 1 位、最長コンテキスト |
| 複雑 Repo 級バグ修正 | Claude Fable 5 | FrontierSWE で大幅リード |
| ターミナル/ツールチェーン密集 Agent | GPT-5.6 Sol | Terminal Bench 2.1 リード |
| 超長文書分析/マルチモーダル文書理解 | Kimi K3 | OmniDocBench 1 位、ネイティブビジョン + 1M |
| コスト重視 | DeepSeek V4 Pro | 出力 $3.48/M と K3 より大幅に安い |
| オープンソース自ホスト(近々) | Kimi K3(7/27 以降) | 最強オープン重み、2.8T 新基準 |
[ SECTION_05 ] // OPEN_SOURCE 7 月 27 日オープンソース:重み公開の意味
Moonshot は WeChat 公式告知で 2026 年 7 月 27 日に完全モデル重みを公開すると明言しました。公開後、Kimi K3 はダウンロード可能な最大オープンソースモデル、2 兆パラメータ超の初のオープン重み、コミュニティの学習/微調整ベースの新標準になります。Hugging Face には MXFP4/NVFP4 量子化版が登場し、vLLM、SGLang など主要推論フレームワークが初日対応する見込みです。
再確認:2.8T 重みはコンシューマ向けローカルデプロイではありません。本番推論には NVIDIA H100 等 64 枚以上のスーパーノードが必要——推論事業者と十分なリソースを持つ研究機関向けです。
| 日時 | イベント |
|---|---|
| 2026 年 7 月 16 日 | Kimi K3 API 静かに公開、ドキュメントバナーと料金ページ同時 |
| 2026 年 7 月 17–20 日 | WAIC 上海(世界人工知能大会)、追加発表とエコシステム連携見込み |
| 2026 年 7 月 27 日 | 完全モデル重みを Hugging Face で公開 |
| 2026 年 8 月 11 日 | ¥199 プリペイド優待終了 |
Kimi K3 は中国 AI オープンエコシステムの新シグナルです。「低価格でシェア獲得」から、知能フロンティアへの挑戦へ。注目:7 月 17–20 日 WAIC → 7 月 27 日重み公開。
[ SECTION_06 ] // DATA 引用可能データ、FAQ、まとめ
- パラメータ規模:2.8T 総パラメータ、896 エキスパート MoE、毎回 16 アクティブ、スパース度 1.8%。
- KDA 効率:3:1 線形/全注意交互、KV キャッシュ 75% 削減、1M コンテキストでデコード 6.3 倍。
- AttnRes:学習効率約 25% 向上、追加計算 <2%。
- スケーリング効率:Kimi K2 比で約 2.5 倍。
- 総合知能指数:Artificial Analysis Intelligence Index v4.1 で 57.1 点、世界 4 位。
- API 料金:$3/$15 per 1M tokens、キャッシュヒット $0.30;国内 ¥20/¥100/¥2。
FAQ:
- Kimi K3 は無料で使えますか? はい——kimi.com の無料アカウントで最大推論モード。API は有料 Key、$3/$15 per 1M tokens。
- ローカルで Kimi K3 を動かせますか? 7 月 27 日までは不可。重み公開後も本番には 64+ アクセラレータが必要。Mac Mini やノート PC では 2.8T 推論は非現実的です。
- K3 と DeepSeek V4 Pro の比較は? K3 はパラメータ約 2 倍(2.8T vs 1.6T)、コンテキスト 1M vs 128K、複数ベンチで優位。ただし DeepSeek V4 Pro 出力は $3.48/M と大幅に安い。
- 1M token コンテキストは実用的ですか? リポジトリ全体分析、長編論文/法務文書の端到端処理、長記憶 Agent に有効。K3 はフラット料金で長さ追加料金なし。
- ベンチマークは信頼できますか? Moonshot 自報でハーネス非統一。実タスクで A/B テストを推奨。
- low/high 推論モードはいつ? Moonshot は
lowとhighを今後提供予定。現状はmaxのみ。
Kimi K3 はパラメータ競争の見せかけではありません。KDA、AttnRes、Stable LatentMoE は実際の工学革新であり、長時間コーディングと文書理解で一部クローズド旗艦に匹敵または上回ります。すべてのベンチで勝つわけではなく——Claude Fable 5 と GPT-5.6 Sol が特定タスクで先行——1M コンテキストと Sonnet 級料金の組み合わせが独自の価値です。
主要参考リンク。発版後は再度開いて確認してください。
Moonshot AI 公式ブログ:Kimi K3 発表と技術解説
Artificial Analysis Intelligence Index
South China Morning Post: Moonshot AI releases Kimi K3
VentureBeat: Kimi K3 open-source LLM coverage
iOS アプリテスト、マルチモデル Agent ルーティング、API 統合検証を2.8T ローカル推論クラスタや未公開の Hugging Face 重みだけに依存すると、64+ GPU のコストと 7 月 27 日までの空白期間が工程を乱します。API 試行だけでは7×24 安定の Xcode 同機 CI と Apple Silicon ネイティブビルドチェーンを代替できません。
Kimi K3 接続期間中にApple Silicon 実行面を固定し、iOS CI/CD と AI Agent 本番検証を安定化するなら——Xcode ビルド、Fastlane、マルチモデル Agent 自動化を専有ベアメタル Mac Mini に移し、K3 API 呼び出しの工程検証に使う(2.8T 重みのローカル実行ではない)——GPU スーパーノード自建や不確実なローカル推論より制御しやすい場合が多いです。NOVAKVM は多リージョン Mac Mini M4 / M4 Pro の柔軟レンタル、固定帯域、デフォルト SSH を提供し、iOS 工程と AI Agent 自動化の同機検証に適しています。詳細は料金、注文、ヘルプセンターをご覧ください。