若你是AI 開發者、技術選型負責人或關注開源大模型的從業者,2026 年 7 月 16 日深夜月之暗面(Moonshot AI)在 API 文件頂部悄然掛出「Kimi K3 已上線!」橫幅——沒有大型發表會,卻發布了2.8 兆(2.8T)參數、迄今全球最大開源 AI 模型。本文涵蓋MoE 896 專家/16 活躍、100 萬 token 上下文與原生視覺能力、KDA/AttnRes/Stable LatentMoE 三大架構創新、與 Claude Fable 5/GPT-5.6 Sol 的完整基準對照、$3/$15 定價與國內 ¥20/¥100 費率、四種立即接入方式、7 月 27 日 Hugging Face 權重開源承諾,以及 6 條 FAQ。節點方案見 定價頁。
[ SECTION_01 ] // OVERVIEW Kimi K3 是什麼?2.8T 靜默發布與核心規格一覽
Kimi K3 是目前全球參數規模最大的開源 AI 模型——2.8T 參數,超越此前紀錄保持者 DeepSeek V4 Pro(1.6T)近 75%,是小米開源模型(1.02T)的 2.7 倍,是阿里(397B)的 7 倍有餘。它採用稀疏混合專家(MoE)架構,推理時從 896 個專家中啟用 16 個;配合 100 萬 token 超長上下文(約等於一次性讀完 5 本《紅樓夢》全文)以及原生視覺理解能力,專為複雜程式設計、長文件推理與知識工作場景設計。
一句話總結:Kimi K3 是一個開源的、可原生理解影像與影片的、擁有超長記憶的「重量級程式設計 AI」,價格比 Claude Opus 4.8 便宜約 40%,且完整權重將於 7 月 27 日對外開源。
對開發者與團隊而言,K3 落地前需正視三大痛點:
- 本地部署門檻極高:2.8T 參數意味著生產級自託管需 64 張以上加速卡的超節點配置,消費級硬體無法承載——權重開源不等於「筆電可跑」。
- 基準數據尚待獨立複現:月之暗面自報成績使用了 Kimi Code、Codex、Claude Code 等不同推理 harness,第三方複現仍在進行中,不宜僅憑單表做採購決策。
- 並非全場景最優:FrontierSWE、Terminal Bench 2.1 等單項仍被 Claude Fable 5 或 GPT-5.6 Sol 領先;選型須按具體任務矩陣而非「參數最大」一刀切。
| 維度 | Kimi K3 |
|---|---|
| 總參數量 | 2.8 兆(2.8T) |
| 架構 | KDA + AttnRes + Stable LatentMoE |
| MoE 稀疏度 | 896 專家,每次啟用 16 個(1.8%) |
| 上下文視窗 | 1,048,576 token(1M) |
| 輸入模態 | 文字、影像、影片 |
| API 模型 ID | kimi-k3 |
| 開源權重 | 2026 年 7 月 27 日 Hugging Face |
靜默發布與 2.8T 體量形成鮮明對比——這不是參數堆砌的面子工程,而是商業化爆發期的技術主權宣示。
[ SECTION_02 ] // ARCHITECTURE DeepSeek 衝擊後的反擊:商業背景與三大架構創新
月之暗面在過去 18 個月經歷了 DeepSeek 崛起帶來的巨大衝擊,市場份額一度大幅萎縮。K3 發布堪稱一次漂亮的反擊,且發布時間恰在 2026 世界人工智慧大會(WAIC)開幕前夜,戰略訊號極強:
- 過去 12 個月裡,Kimi 系列模型有 9 個月佔據開源模型規模上限的位置;
- 截至 2026 年 6 月,月之暗面 ARR(年度經常性收入)已突破 3 億美元;
- 今年內已完成第 6 輪融資,投前估值達 315 億美元;
- API 收入佔整體收入 七成以上,海外付費使用者成長 400%。
Kimi Delta Attention(KDA)—— 重新設計注意力機制
傳統 Transformer 全注意力在長上下文下計算量呈平方級成長,100 萬 token 時 KV 快取記憶體消耗是毀滅性的。KDA 是混合線性注意力機制:
- 以 3:1 比例交替使用線性注意力層與全注意力層——3 個線性層處理局部序列(計算廉價),1 個全注意力層保留全域資訊流;
- KV 快取記憶體減少高達 75%;
- 百萬 token 上下文下,解碼速度提升高達 6.3 倍;
- 在短上下文、長上下文和強化學習擴展三種場景中,均超越純全注意力基線。
Attention Residuals(AttnRes)—— 解決深度資訊遺失
- 標準殘差連接會將資訊沿深度均勻累積,導致早期層關鍵表徵在深層被稀釋;
- AttnRes 引入選擇性檢索——模型可跨越深度直接拉取更早層的高價值表徵;
- 月之暗面報告約 25% 訓練效率提升,額外計算開銷不足 2%。
Stable LatentMoE —— 超高稀疏度的穩定訓練
Kimi K3 共 896 個專家、每次推理啟用 16 個,稀疏度達 1.8%。Moonshot 配套技術包括 Quantile Balancing(從路由器得分分位數推導專家分配)、Per-Head Muon(每個注意力頭獨立最佳化)、Sigmoid Tanh Unit(SiTU)與 Gated MLA。綜合架構創新,K3 相較 Kimi K2 整體擴展效率提升約 2.5 倍。
| 技術 | 作用 |
|---|---|
| Quantile Balancing | 從路由器得分分位數直接推導專家分配,消除啟發式超參 |
| Per-Head Muon | 針對每個注意力頭獨立最佳化,使大規模訓練更自適應 |
| SiTU | 改進啟動函數控制 |
| Gated MLA | 提升注意力選擇性 |
[ SECTION_03 ] // BENCHMARKS 基準測試全表:K3 強在哪?定價怎麼比?
月之暗面自報核心基準數據如下(含 GLM-5.2 對照):
| 基準測試 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 12.9 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 91.2 |
| MMMU-Pro(視覺) | 81.6 | 81.2 | 83.0 | 78.9 | — |
| OmniDocBench(文件理解) | 91.1 | 89.8 | 85.8 | 87.9 | — |
解讀重點:程式設計長任務(SWE Marathon)K3 以 42.0 大幅領先;Program Bench 微幅第一(77.8 vs 76.8);FrontierSWE 由 Fable 5 領跑(86.6);文件理解 OmniDocBench K3 第一(91.1),體現視覺 + 長上下文協同優勢。在 Artificial Analysis Intelligence Index v4.1 中,K3 以 57.1 分排名第四,緊隨 Claude Fable 5(59.9)和 GPT-5.6 Sol(58.9)之後,與第一梯隊差距僅 2.8 分。
注意事項:上述基準為月之暗面自報數據,不同模型使用了各自的推理 harness(K3 用 Kimi Code,GPT 用 Codex,Claude 用 Claude Code),獨立第三方複現工作仍在進行中。請將其視為方向性參考,而非最終定論。
| 模型 | 輸入 | 輸出 | 快取命中輸入 | 上下文 |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00(促銷 $2) | $15.00(促銷 $10) | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
K3 標準價與 Claude Sonnet 5 持平($3/$15),但提供 5 倍上下文;快取命中低至 $0.30/M(標準價 1/10),月之暗面報告程式設計場景快取命中率超過 90%。國內 API 定價:¥20/M(輸入)、¥100/M(輸出)、快取命中 ¥2/M;消費者版在 kimi.com 免費帳號即可使用,預付費套餐 ¥199 起(優惠截至 8 月 11 日)。
[ SECTION_04 ] // ACCESS 四種接入方式、六步落地清單與場景選型矩陣
Kimi K3 現已可透過以下四種方式立即呼叫:
- 方法一 — Kimi 網頁/App:造訪 kimi.com,註冊帳號(支援 Google 帳號),K3 預設以最大推理力度執行,無需信用卡。
- 方法二 — 官方 API:在 platform.kimi.ai 取得 API Key,模型 ID 為
kimi-k3,OpenAI 相容介面。 - 方法三 — OpenRouter:模型 ID
moonshotai/kimi-k3,Moonshot 官方定價,無額外加價,完整 1M 上下文。 - 方法四 — 等 7 月 27 日開源權重:完整模型權重將於 Hugging Face 開放,生產級部署需 64 張以上加速卡超節點。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "幫我分析這段程式碼..."}]
)
- 明確任務邊界:對照上文基準矩陣,確認你的場景屬於 SWE Marathon 長程式碼、Repo 級修 Bug、終端 Agent 還是文件多模態——避免「參數最大」誤選。
- 註冊並驗證 kimi.com:用 Google 帳號快速註冊,在 Web 端試跑典型 Prompt,確認視覺與長上下文是否符合預期。
- 申請 Moonshot API Key:登入 platform.kimi.ai,建立 Key 並設定用量告警;國內使用者核對 ¥20/¥100/¥2 費率與 ¥199 預付費套餐。
- 接入 OpenAI 相容 SDK:將
base_url指向https://api.moonshot.ai/v1,模型 ID 固定kimi-k3;若已有 OpenRouter 帳號,可直接切換moonshotai/kimi-k3。 - 啟用快取策略:程式設計工作流重複上下文比例高,Moonshot 報告快取命中率超 90%——按 Mooncake 分推理架構設計 Prompt 結構,降低有效輸入成本至約 $0.55/M。
- 固定工程驗證環境:把 Xcode 建置、Fastlane 與多模型 Agent 路由遷到7×24 穩定 Apple Silicon 宿主,API 試跑與 iOS CI/CD 同機驗證;K3 自託管需等 7 月 27 日權重且需 64+ GPU,不應把 iOS 發布節奏押在本地推理叢集上——詳見下文 NOVAKVM 方案。
| 場景 | 推薦模型 | 原因 |
|---|---|---|
| 持續性長程式碼任務(SWE Marathon 類) | Kimi K3 | 基準第一,上下文最長 |
| 複雜 Repo 級別修 Bug | Claude Fable 5 | FrontierSWE 大幅領先 |
| 終端/工具鏈密集型 Agent | GPT-5.6 Sol | Terminal Bench 2.1 領先 |
| 超長文件分析/多模態文件理解 | Kimi K3 | OmniDocBench 第一,原生視覺 + 1M 上下文 |
| 成本敏感場景 | DeepSeek V4 Pro | 輸出僅 $3.48/M,遠低於 K3 |
| 開源自部署(近期) | Kimi K3(7/27 後) | 最強開源權重,2.8T 新標竿 |
[ SECTION_05 ] // OPEN_SOURCE 7 月 27 日開源承諾:權重開放後意味著什麼?
月之暗面在官方 WeChat 公告中明確承諾:2026 年 7 月 27 日開放完整模型權重。一旦權重開放,Kimi K3 將成為迄今參數最大的可下載開源模型、首個超 2 兆參數級別的開源權重,以及開源社群訓練/微調基座新標竿。Hugging Face 上將出現 MXFP4/NVFP4 量化版本,vLLM、SGLang 等主流推理框架預計第一時間支援。
需再次強調:2.8T 權重不等於消費級本地部署。生產級推理需 64 張以上加速卡(如 NVIDIA H100)的超節點配置——這是面向推理服務商與資源充足研究實驗室的模型,而非筆電 LLM。
| 時間 | 事件 |
|---|---|
| 2026 年 7 月 16 日 | Kimi K3 API 靜默上線,文件橫幅與定價頁同步發布 |
| 2026 年 7 月 17–20 日 | WAIC 上海(世界人工智慧大會),預計更多發布與生態合作 |
| 2026 年 7 月 27 日 | 完整模型權重於 Hugging Face 開放下載 |
| 2026 年 8 月 11 日 | ¥199 預付費套餐優惠截止 |
Kimi K3 代表了中國 AI 開源生態的新訊號:不再是「以低價換市場」,而是在真正挑戰智慧前沿。關注節點:7 月 17–20 日 WAIC → 7 月 27 日權重開源。
[ SECTION_06 ] // DATA 可引用技術數據、FAQ 與總結
- 參數規模:2.8T 總參數,896 專家 MoE、每次啟用 16 個,稀疏度 1.8%。
- KDA 效率:3:1 線性/全注意力交替,KV 快取減少 75%,1M 上下文解碼加速 6.3 倍。
- AttnRes:訓練效率提升約 25%,額外計算開銷 <2%。
- 擴展效率:相較 Kimi K2 整體擴展效率提升約 2.5 倍。
- 綜合智慧指數:Artificial Analysis Intelligence Index v4.1 得分 57.1,全球第四。
- API 定價:$3/$15 per 1M tokens,快取命中 $0.30;國內 ¥20/¥100/¥2。
FAQ 精選:
- Kimi K3 可以免費使用嗎? 可以——kimi.com 免費帳號即可體驗,預設最大推理力度。API 呼叫需付費 Key,按 $3/$15 per 1M tokens 計費。
- 能在本地跑 Kimi K3 嗎? 7 月 27 日前不行;權重開放後生產級推理仍需 64+ 加速卡超節點,消費級硬體不現實。Mac Mini 或筆電無法承載 2.8T 推理。
- K3 和 DeepSeek V4 Pro 怎麼比? K3 參數近翻倍(2.8T vs 1.6T)、上下文大得多(1M vs 128K)、多項基準更強;但 DeepSeek V4 Pro 輸出僅 $3.48/M,成本顯著更低。
- 1M token 上下文真的有用嗎? 對整庫程式碼分析、長篇論文/法律文件端到端處理、多輪 Agent 長記憶尤其有價值;K3 按 flat 定價無長度附加費,實際可用滿視窗。
- 基準數據可信嗎? 月之暗面自報且 harness 不統一,獨立複現進行中。建議結合你的真實任務做 A/B,而非僅憑公開表格採購。
- 低/高推理力度模式何時上線? Moonshot 表示
low與high模式將在後續更新推出;目前僅max可用。
Kimi K3 不是參數堆砌的面子工程:KDA、AttnRes、Stable LatentMoE 做了真正的工程創新,在程式設計長任務與文件理解等關鍵賽道對標乃至超越部分閉源旗艦,定價合理,且承諾完整開源。它未必贏得每一項 benchmark——Claude Fable 5 與 GPT-5.6 Sol 在特定 coding 與 reasoning 任務仍領先——但在長程 coding 與文件理解上表現突出,並以 1M token 上下文和 Sonnet 級定價形成獨特組合。
以下為主要參考來源,發版或入庫後請再次開啟連結核對:
OpenRouter:moonshotai/kimi-k3 模型頁
Artificial Analysis Intelligence Index
South China Morning Post: Moonshot AI releases Kimi K3
VentureBeat: Kimi K3 open-source LLM coverage
若你把 iOS 應用測試、多模型 Agent 路由與 API 整合驗證完全押在 2.8T 本地推理叢集或尚未開放的 Hugging Face 權重上,64+ GPU 超節點成本與 7 月 27 日前的時間空窗都會直接打亂工程節奏;純 API 試跑也無法替代穩定 7×24 的 Xcode 同機 CI 與 Apple Silicon 原生建置鏈。
若你需要在 Kimi K3 接入窗口期固定 Apple Silicon 執行面、穩定 iOS CI/CD 與 AI Agent 生產驗證——把 Xcode 建置、Fastlane 與多模型 Agent 自動化遷到獨占裸金屬 Mac Mini,用於呼叫 K3 API 的工程驗證而非本地跑 2.8T 權重——通常比自建 GPU 超節點或依賴不確定的本地推理更可控:NOVAKVM 提供多區域 Mac Mini M4 / M4 Pro 彈性租期,固定頻寬與預設 SSH 存取,適合 iOS 工程與 AI Agent 自動化同機驗證。方案見 定價頁,下單見 訂購頁,部署問題見 雲端說明中心。