Kimi K3 徹底解説:2.8 兆パラメータ、
オープンソース LLM の新記録

AI 開発者、技術選定担当、オープンソース LLM を追うエンジニア向けに、2026 年 7 月 16 日深夜、Moonshot AI(月之暗面)が API ドキュメント上部に「Kimi K3 提供開始」のバナーを静かに掲げました。大規模キーノートはなく、2.8 兆(2.8T)パラメータという現時点で世界最大のオープンソース AI モデルがそのまま呼び出し可能になったのです。本記事ではMoE 896 エキスパート/16 アクティブ、100 万 token コンテキストとネイティブビジョン、KDA/AttnRes/Stable LatentMoE の 3 大アーキテクチャ革新、Claude Fable 5/GPT-5.6 Sol とのベンチマーク全表、$3/$15 および国内 ¥20/¥100 料金、4 つの即時接続方法、7 月 27 日 Hugging Face 重み公開、6 項目の FAQをまとめます。ノード料金は料金ページをご覧ください。

Kimi K3 は世界最大規模のオープンソース AI モデルです。2.8T パラメータは、従来記録保持者 DeepSeek V4 Pro(1.6T)を約 75% 上回り、Xiaomi のオープンモデル(1.02T)の 2.7 倍、Alibaba(397B)の 7 倍以上です。スパース MoE アーキテクチャで、推論時に 896 エキスパートから 16 個をアクティブ化します。100 万 token の超長コンテキスト(『紅楼夢』全 5 冊相当を一度に読み込める規模)とネイティブな画像・動画理解を備え、複雑なコーディング、長文推論、ナレッジワーク向けに設計されています。

要約すると、Kimi K3 は画像・動画をネイティブ理解し、超長記憶を持つオープンソースの「重量級コーディング AI」です。Claude Opus 4.8 より約 40% 安く、7 月 27 日に完全な重みが公開される予定です。

導入前に押さえるべき 3 つの痛点は次のとおりです。

  • ローカルデプロイの壁:2.8T は本番セルフホストに 64 枚以上のアクセラレータを要するスーパーノード規模です。重み公開は「ノート PC で動く」ことを意味しません。
  • ベンチマークの独立検証待ち:Moonshot 自報値は Kimi Code、Codex、Claude Code などハーネスが異なります。第三者再現は進行中で、単一表だけで調達判断すべきではありません。
  • 全シナリオ最強ではない:FrontierSWE や Terminal Bench 2.1 では Claude Fable 5 や GPT-5.6 Sol が先行しています。「最大パラメータ」一択ではなくタスク行列で選ぶ必要があります。
Kimi K3 コア仕様一覧
項目 Kimi K3
総パラメータ数 2.8 兆(2.8T)
アーキテクチャ KDA + AttnRes + Stable LatentMoE
MoE スパース度 896 エキスパート、毎回 16 個アクティブ(1.8%)
コンテキストウィンドウ 1,048,576 token(1M)
入力モダリティ テキスト、画像、動画
API モデル ID kimi-k3
オープン重み 2026 年 7 月 27 日 Hugging Face

静かな公開と 2.8T のスケールは対照的です。パラメータ競争の見せかけではなく、商用化フェーズにおける技術的主権の表明と読めます。

月之暗面は過去 18 か月、DeepSeek の台頭でシェアを大きく失いました。K3 の公開は見事な反撃であり、2026 世界人工知能大会(WAIC)前夜というタイミングも戦略的です。

  • 過去 12 か月のうち 9 か月、Kimi 系列がオープンソース最大規模を保持;
  • 2026 年 6 月時点で ARR(年間経常収益)は 3 億米ドルを突破;
  • 年内に 第 6 ラウンド資金調達、投前評価額 315 億米ドル
  • API 収入が全体の 7 割超、海外有料ユーザー 400% 成長。

Kimi Delta Attention(KDA)—— 注意機構の再設計

従来の Transformer 全注意は長コンテキストで計算量が二乗に増え、100 万 token では KV キャッシュのメモリ消費が致命的です。KDA は混合線形注意機構です。

  • 3:1で線形注意層と全注意層を交互配置——3 層が局所、1 層がグローバル情報を保持;
  • KV キャッシュメモリを最大 75% 削減;
  • 100 万 token コンテキストでデコード速度が最大 6.3 倍
  • 短・長コンテキストおよび RL 拡張の各シナリオで純全注意ベースラインを上回ります。

Attention Residuals(AttnRes)—— 深度方向の情報損失対策

  • 標準残差接続は深度に沿って情報を均一に蓄積し、浅層の重要表現が希薄化;
  • AttnRes は選択的取得により、より浅い層の高価値表現を直接引き出せます;
  • Moonshot 報告では約 25% の学習効率向上、追加計算コストは 2% 未満

Stable LatentMoE —— 超高スパースの安定学習

Kimi K3 は 896 エキスパートから 16 個を推論時にアクティブ化し、スパース度 1.8% です。Quantile Balancing、Per-Head Muon、Sigmoid Tanh Unit(SiTU)、Gated MLA を組み合わせ、Kimi K2 比で全体のスケーリング効率が約 2.5 倍向上したと報告されています。

Stable LatentMoE 付随技術一覧
技術 役割
Quantile Balancing ルータースコアの分位点からエキスパート割当を直接導出、ヒューリスティック超パラを排除
Per-Head Muon 各注意ヘッドを独立最適化し、大規模学習を適応的に
SiTU 活性化関数の制御を改善
Gated MLA 注意の選択性を向上

Moonshot 自報のコアベンチマーク(GLM-5.2 対照含む)は以下のとおりです。

Kimi K3 とクローズド/オープン旗艦のベンチマーク対照(Moonshot 自報、2026-07-16)
ベンチマーク Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GLM-5.2
DeepSWE 67.5 70.0 73.0 59.0 46.2
Program Bench 77.8 76.8 77.6 71.9 63.7
Terminal Bench 2.1 88.3 84.6 88.8 84.6 82.7
FrontierSWE 81.2 86.6 71.3 66.7 67.3
SWE Marathon 42.0 35.0 39.0 40.0 13.0
BrowseComp 91.2 88.0 90.4 84.3
Automation Bench 30.8 29.1 29.7 27.2 12.9
GPQA-Diamond 93.5 92.6 94.1 91.0 91.2
MMMU-Pro(ビジョン) 81.6 81.2 83.0 78.9
OmniDocBench(文書理解) 91.1 89.8 85.8 87.9

要点:長時間コーディング(SWE Marathon)で K3 は 42.0 と大差リード。Program Bench も 77.8 で首位。FrontierSWE は Fable 5 が 86.6 で先行。OmniDocBench 91.1 はビジョン + 長コンテキストの相乗効果を示します。Artificial Analysis Intelligence Index v4.1 では K3 は 57.1 点で世界 4 位、Claude Fable 5(59.9)と GPT-5.6 Sol(58.9)に続き、1 位との差は 2.8 点のみです。

注意:上記は Moonshot 自報値です。モデルごとに推論ハーネスが異なり(K3 は Kimi Code、GPT は Codex、Claude は Claude Code)、独立再現は進行中です。方向性の参考として扱い、最終判断にはしないでください。

API 料金対照($/M token、2026-07-16)
モデル 入力 出力 キャッシュヒット入力 コンテキスト
Kimi K3 $3.00 $15.00 $0.30 1M
Claude Sonnet 5 $3.00(プロモ $2) $15.00(プロモ $10) 200K
Claude Opus 4.8 $5.00 $25.00 200K
GPT-5.5 $5.00 $30.00 400K
DeepSeek V4 Pro $1.74 $3.48 $0.145 128K
Kimi K2.6 $0.95 $4.00 $0.16 256K

K3 の標準料金は Claude Sonnet 5 と同じ $3/$15 ですが、5 倍のコンテキストを提供します。キャッシュヒットは $0.30/M(標準の 1/10)で、Moonshot はコーディング用途でキャッシュヒット率 90% 超を報告しています。国内 API:¥20/M(入力)、¥100/M(出力)、キャッシュヒット ¥2/Mkimi.com の無料アカウントで利用可能、プリペイド ¥199 から(8 月 11 日までの優待)。

Kimi K3 は次の 4 方法ですぐに呼び出せます。

  • 方法 1 — Kimi Web/App:kimi.com でアカウント登録(Google 連携可)。K3 は最大推論モードで動作、クレジットカード不要。
  • 方法 2 — 公式 API:platform.kimi.ai で API Key を取得。モデル ID は kimi-k3、OpenAI 互換。
  • 方法 3 — OpenRouter:モデル ID moonshotai/kimi-k3。Moonshot 公式料金、マークアップなし、1M コンテキスト完全対応。
  • 方法 4 — 7 月 27 日のオープン重み待ち:Hugging Face で完全重み公開。本番デプロイには 64 枚以上のアクセラレータが必要。
kimi_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "このコードを分析してください..."}]
)
  1. タスク境界の明確化:上記ベンチマーク表で、SWE Marathon 型長コード、Repo 級バグ修正、ターミナル Agent、文書マルチモーダルのどれに該当するか確認します。
  2. kimi.com で登録・検証:Google アカウントで登録し、Web で典型 Prompt を試し、ビジョンと長コンテキストを確認します。
  3. Moonshot API Key 申請:platform.kimi.ai で Key を作成し用量アラートを設定。国内ユーザーは ¥20/¥100/¥2 と ¥199 プリペイドを確認します。
  4. OpenAI 互換 SDK 接続:base_urlhttps://api.moonshot.ai/v1、モデル ID を kimi-k3 に固定。OpenRouter 利用時は moonshotai/kimi-k3 に切替えます。
  5. キャッシュ戦略の有効化:コーディングワークフローは繰返しコンテキストが多く、ヒット率 90% 超——Mooncake 分推論アーキテクチャに沿った Prompt 設計で実効入力コストを約 $0.55/M まで下げます。
  6. 検証環境の固定:Xcode ビルド、Fastlane、マルチモデル Agent ルーティングを7×24 安定 Apple Silicon ホストへ移し、API 試行と iOS CI/CD を同一マシンで検証します。K3 セルフホストは 7 月 27 日以降で 64+ GPU が必要——iOS リリースのペースをローカル推論クラスタに賭けるべきではありません。NOVAKVM 案は下文参照。
Kimi K3 シナリオ選定マトリクス
シナリオ 推奨モデル 理由
持続的長コードタスク(SWE Marathon 型) Kimi K3 ベンチ 1 位、最長コンテキスト
複雑 Repo 級バグ修正 Claude Fable 5 FrontierSWE で大幅リード
ターミナル/ツールチェーン密集 Agent GPT-5.6 Sol Terminal Bench 2.1 リード
超長文書分析/マルチモーダル文書理解 Kimi K3 OmniDocBench 1 位、ネイティブビジョン + 1M
コスト重視 DeepSeek V4 Pro 出力 $3.48/M と K3 より大幅に安い
オープンソース自ホスト(近々) Kimi K3(7/27 以降) 最強オープン重み、2.8T 新基準

Moonshot は WeChat 公式告知で 2026 年 7 月 27 日に完全モデル重みを公開すると明言しました。公開後、Kimi K3 はダウンロード可能な最大オープンソースモデル、2 兆パラメータ超の初のオープン重み、コミュニティの学習/微調整ベースの新標準になります。Hugging Face には MXFP4/NVFP4 量子化版が登場し、vLLM、SGLang など主要推論フレームワークが初日対応する見込みです。

再確認:2.8T 重みはコンシューマ向けローカルデプロイではありません。本番推論には NVIDIA H100 等 64 枚以上のスーパーノードが必要——推論事業者と十分なリソースを持つ研究機関向けです。

Kimi K3 主要タイムライン
日時 イベント
2026 年 7 月 16 日 Kimi K3 API 静かに公開、ドキュメントバナーと料金ページ同時
2026 年 7 月 17–20 日 WAIC 上海(世界人工知能大会)、追加発表とエコシステム連携見込み
2026 年 7 月 27 日 完全モデル重みを Hugging Face で公開
2026 年 8 月 11 日 ¥199 プリペイド優待終了

Kimi K3 は中国 AI オープンエコシステムの新シグナルです。「低価格でシェア獲得」から、知能フロンティアへの挑戦へ。注目:7 月 17–20 日 WAIC7 月 27 日重み公開

  • パラメータ規模:2.8T 総パラメータ、896 エキスパート MoE、毎回 16 アクティブ、スパース度 1.8%。
  • KDA 効率:3:1 線形/全注意交互、KV キャッシュ 75% 削減、1M コンテキストでデコード 6.3 倍。
  • AttnRes:学習効率約 25% 向上、追加計算 <2%。
  • スケーリング効率:Kimi K2 比で約 2.5 倍。
  • 総合知能指数:Artificial Analysis Intelligence Index v4.1 で 57.1 点、世界 4 位。
  • API 料金:$3/$15 per 1M tokens、キャッシュヒット $0.30;国内 ¥20/¥100/¥2。

FAQ:

  • Kimi K3 は無料で使えますか? はい——kimi.com の無料アカウントで最大推論モード。API は有料 Key、$3/$15 per 1M tokens。
  • ローカルで Kimi K3 を動かせますか? 7 月 27 日までは不可。重み公開後も本番には 64+ アクセラレータが必要。Mac Mini やノート PC では 2.8T 推論は非現実的です。
  • K3 と DeepSeek V4 Pro の比較は? K3 はパラメータ約 2 倍(2.8T vs 1.6T)、コンテキスト 1M vs 128K、複数ベンチで優位。ただし DeepSeek V4 Pro 出力は $3.48/M と大幅に安い。
  • 1M token コンテキストは実用的ですか? リポジトリ全体分析、長編論文/法務文書の端到端処理、長記憶 Agent に有効。K3 はフラット料金で長さ追加料金なし。
  • ベンチマークは信頼できますか? Moonshot 自報でハーネス非統一。実タスクで A/B テストを推奨。
  • low/high 推論モードはいつ? Moonshot は lowhigh を今後提供予定。現状は max のみ。

Kimi K3 はパラメータ競争の見せかけではありません。KDA、AttnRes、Stable LatentMoE は実際の工学革新であり、長時間コーディングと文書理解で一部クローズド旗艦に匹敵または上回ります。すべてのベンチで勝つわけではなく——Claude Fable 5 と GPT-5.6 Sol が特定タスクで先行——1M コンテキストと Sonnet 級料金の組み合わせが独自の価値です。

主要参考リンク。発版後は再度開いて確認してください。

Moonshot AI 公式ブログ:Kimi K3 発表と技術解説

Kimi API Platform ドキュメントと料金

OpenRouter:moonshotai/kimi-k3

Artificial Analysis Intelligence Index

South China Morning Post: Moonshot AI releases Kimi K3

VentureBeat: Kimi K3 open-source LLM coverage

iOS アプリテスト、マルチモデル Agent ルーティング、API 統合検証を2.8T ローカル推論クラスタや未公開の Hugging Face 重みだけに依存すると、64+ GPU のコストと 7 月 27 日までの空白期間が工程を乱します。API 試行だけでは7×24 安定の Xcode 同機 CI と Apple Silicon ネイティブビルドチェーンを代替できません。

Kimi K3 接続期間中にApple Silicon 実行面を固定し、iOS CI/CD と AI Agent 本番検証を安定化するなら——Xcode ビルド、Fastlane、マルチモデル Agent 自動化を専有ベアメタル Mac Mini に移し、K3 API 呼び出しの工程検証に使う(2.8T 重みのローカル実行ではない)——GPU スーパーノード自建や不確実なローカル推論より制御しやすい場合が多いです。NOVAKVM は多リージョン Mac Mini M4 / M4 Pro の柔軟レンタル、固定帯域、デフォルト SSH を提供し、iOS 工程と AI Agent 自動化の同機検証に適しています。詳細は料金注文ヘルプセンターをご覧ください。