Kimi K3 權重全面釋出:
2.8 兆參數、百萬上下文,月之暗面這次釋出了什麼?

若你是正在評估 Kimi K3 接入、自部署或商用合規的 AI 開發者與企業技術負責人,7 月 27 日晚月之暗面(Moonshot AI)釋出的完整權重與技術報告,很可能改寫你對「國產 3T 級模型」的認知邊界。Kimi K3 擁有 2.8 兆總參數、100 萬 token 上下文,並同步開源 MoonEP、FlashKDA、AgentEnv 三項核心基礎設施——距 API 首發僅 11 天。本文涵蓋時間軸、架構創新(KDA/AttnRes/Per-Head Muon)、Infra 開源、SWE-bench 與 Artificial Analysis 基準、開放權重授權兩道商業門檻、API 定價與六步接入清單;可與 7 月 16 日 K3 首發評測蒸餾門爭議篇OpenRouter 7 月榜 交叉閱讀。定價見 定價頁

7 月 27 日晚 23 點左右,月之暗面正式釋出 Kimi K3 完整模型權重與技術報告,權重檔案在 Hugging Face 上體積約 1.56TB,上線半小時內即登頂趨勢榜第一。這是全球首個被完整釋出的 3 兆參數級別模型——但官方從未使用「open source」,一直採用「open weight(開放權重)」表述。

  • 概念混淆:媒體普遍翻譯為「開源」,但 OSI 標準下的開源須公開訓練資料與完整訓練程式碼;K3 僅公開權重、技術報告與推理 Infra,訓練管線不可復現。
  • 授權條款盲區:K3 授權新增兩道 K2 系列沒有的商業門檻——Model-as-a-Service 年收入超 2000 萬美元須另行簽約;月活超 1 億或月收入超 2000 萬美元須顯著展示「Kimi K3」字樣。
  • 自部署幻覺:2.8T 參數、896 專家 MoE 決定 K3 幾乎不可能在消費級硬體執行;官方建議 64 卡及以上超節點,個人開發者更現實的路徑是 API 或 OpenRouter。
  • 基準誤讀:廠商自報與獨立第三方複測差異大;SWE-bench Verified 上 K3 為 93.4%,仍低於 Claude Opus 5(97%)與 GPT-5.6 Sol(96.2%),但已是開放權重陣營最強。
  • 成本錯配:K3 每任務成本約 $0.95,比 GLM-5.2(約 $0.47)更貴——它是開放權重能力天花板,而非性價比最優選。
  • 地緣變數:權重釋出前數天,美方指控月之暗面「工業化蒸餾」Anthropic Fable 模型訓練 K3 並威脅制裁;中國商務部 7 月 28 日公開回應指責「AI 霸權主義」。

核心結論:Kimi K3 是開放權重陣營的能力天花板,不是傳統意義的開源專案;對絕大多數中小團隊可正常商用,但若你的商業模式是與月之暗面競爭的模型即服務,授權第一道門檻是法務紅線。

11 天從 API 到權重釋出時間軸:

  • 7 月 16 日夜(WAIC 2026 前夜):Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 Kimi API 首發,僅限線上呼叫,權重尚未公開。
  • 7 月 17 日:業界密集分析架構;新華社報導稱其為「目前全球參數最大的開源模型」。
  • 7 月 22 日–23 日:中美「模型蒸餾」爭端升級;美國白宮科技顧問 Michael Kratsios 指控月之暗面對 Anthropic Fable 模型進行「大規模、隱蔽的工業化蒸餾」。
  • 7 月 27 日晚 23 點:正式釋出 K3 完整權重、技術報告,並開源 MoonEP、AgentEnv(FlashKDA 此前已開源)。
  • 7 月 28 日:中國商務部公開回應;國內多家媒體跟進報導開源細節。

Kimi K3 在架構上重構了深度學習沿用多年的三大傳統元件——注意力機制、殘差連接、最佳化器,這也是它區別於「簡單堆參數」的關鍵。

Kimi K3 核心參數一覽
項目 參數
總參數量2.8 兆(2.8T)
啟用參數量約 1040 億
架構類型混合專家模型(MoE)
專家配置896 個路由專家,每 token 啟用 16 個(另有共享專家)
注意力機制Kimi Delta Attention(KDA)+ 門控多頭潛在注意力(Gated MLA)
上下文視窗100 萬 token
多模態能力原生視覺理解(ViT-V2,27 層)
權重格式MXFP4 權重 + MXFP8 啟用(SFT 階段起量化感知訓練)
權重體積約 1.56TB(Hugging Face)
License自訂授權條款(官方稱 open weight,非 open source)

Kimi Delta Attention(KDA):傳統 Gated DeltaNet 使用純量級遺忘門,KDA 改為逐通道門控——每個特徵維度擁有獨立衰減率,某些特徵長期保留、另一些快速遺忘。採用 chunkwise DPLR 公式實現線性時間遞迴,K3 將 KDA 與少量 Gated MLA 全域注意力層交替混合,支撐 100 萬 token 上下文同時把 KV Cache 開銷壓到極低。

Attention Residuals(AttnRes):傳統殘差連接逐層均勻累加,深層網路早期資訊易被稀釋。AttnRes 改為選擇性、依據輸入動態聚合前面所有層的輸出——每層僅新增一個 RMSNorm 和一個偽查詢向量,帶來約 25% 訓練效率提升,代價不到 2%。

Per-Head Muon:在 Muon 最佳化器基礎上做逐注意力頭獨立最佳化,讓每個頭擁有更自適應的收斂路徑。純訓練期技術,API 呼叫無感知,但堆疊細節讓 K3 以更少啟用參數打出接近頂尖閉源模型效果。

Stable LatentMoE:896 選 16 的稀疏路由(稀疏度約 1.8%),配合共享專家保證基礎能力;採用 Quantile Balancing 均衡策略,配合 MoonEP 從數學上證明每個運算節點冗餘專家數的理論上界。

月之暗面這次沒有只發權重檔案,而是把支撐 K3 訓練效率與穩定性的三項關鍵基礎設施技術一併開源。

三大開源 Infra 技術
技術 定位 關鍵能力
MoonEP 超大規模細粒度 MoE 高效能通訊函式庫 臨時複製過載專家保證每節點均等 token 數;證明冗餘專家數理論上界
FlashKDA 基於 NVIDIA CUTLASS 的 KDA 高效能算子(此前已開源) H20 上 prefill 比 flash-linear-attention 基線快 1.72–2.22 倍;可作為 chunk_kda 直接替代後端
AgentEnv 與 KVCache.ai 聯合開發的 Agent 沙箱(Firecracker microVM) 大規模並行 Agent RL 訓練;官方披露 checkpoint 延遲 133ms、恢復 49ms、記憶體超分最高 6.5 倍(尚未第三方獨立複現)

SWE-bench Verified(獨立複測,Vals AI,截至 2026 年 7 月):

SWE-bench Verified 獨立複測對照
模型 分數 發布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Artificial Analysis 智慧指數(max 推理檔):Claude Fable 5 為 60,GPT-5.6 Sol 為 59,Kimi K3 約 57(全球第 3,開放權重模型第 1),GLM-5.2 為 51,DeepSeek V4 Pro 為 44。K3 目前在 Arena.ai 的 Frontend Code Arena 榜單排名第一。每任務成本約 $0.95,比 Claude Fable 5(約 $2.4)便宜約 60%,但比 GLM-5.2(約 $0.47)更貴。

月之暗面官方材料從未使用「open source」,一直採用「open weight」表述。授權條款是一份完全自訂文件,包含兩道商業門檻:

  1. Model-as-a-Service 收入門檻:若被授權方營運模型即服務業務,且連續 12 個月內該業務累計收入超過 2000 萬美元,須與月之暗面另行簽署商業協議。
  2. 規模展示門檻:若產品月活超過 1 億,或月收入超過 2000 萬美元,須在產品介面顯著展示「Kimi K3」字樣。

API 定價(OpenAI SDK 相容,模型 ID kimi-k3):

Kimi K3 API 定價(每百萬 token)
Token 類型 價格
輸入(快取命中)$0.30
輸入(快取未命中)$3.00
輸出(含推理過程)$15.00

由於 Mooncake 分離式推理架構在典型程式設計類工作負載上快取命中率可達 90% 以上,實際大部分呼叫成本更接近 $0.30 檔,而非 $3 表頭價格。

六步 Kimi K3 接入清單(開發者/小團隊/企業通用):

  1. 明確接入路徑:評估自部署(64 卡超節點)vs 官方 API vs OpenRouter 等第三方託管;絕大多數團隊應選 API 路徑。可參考 OpenRouter 接入教學 做多 Provider 抽象。
  2. 審閱授權條款:下載 Hugging Face 上的 LICENSE 全文,確認你的商業模式不觸發 Model-as-a-Service 收入門檻或規模展示門檻;法務團隊重點審查「與月之暗面競爭的推理服務」場景。
  3. 設定 API 客戶端:將 base URL 設為 Moonshot 官方端點,模型 ID 設為 kimi-k3;現有 OpenAI SDK 專案通常只需改 base URL 與 API Key。
  4. 啟用快取感知計費:對程式設計類 Agent 工作負載設計 prompt 快取策略,利用 Mooncake 高命中率把實際輸入成本壓向 $0.30/M 檔。
  5. 建立分層路由:日常 Agentic Coding 用 K3 或 DeepSeek V4 Flash 跑量;卡住的複雜步驟切 Claude Opus 5 或 GPT-5.6 Sol,避免單一模型帳單失控。參見 7 月 OpenRouter 分層選型
  6. 固化 7×24 Agent 執行環境:長時 Agent 編排、多模型閘道須跑在常駐 macOS 節點而非合蓋即斷的筆電;詳見 說明中心訂購頁
kimi-k3-api-example.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention in one paragraph."}]
)
print(response.choices[0].message.content)

  • 總參數量:2.8 兆,啟用約 1040 億;全球首個完整釋出的 3T 級模型(來源:月之暗面技術報告)。
  • 權重體積:約 1.56TB,Hugging Face 上線半小時登頂趨勢榜第一(來源:Hugging Face)。
  • SWE-bench Verified:K3 獨立複測 93.4%,開放權重陣營最強,仍低於 Claude Opus 5 的 97%(來源:Vals AI,2026 年 7 月)。
  • Artificial Analysis 智慧指數:K3 max 檔約 57,全球第 3、開放權重第 1(來源:Artificial Analysis)。
  • FlashKDA 加速:NVIDIA H20 上 prefill 比 flash-linear-attention 基線快 1.72–2.22 倍(來源:Moonshot GitHub)。
  • API 快取命中價:輸入 $0.30/M(快取命中)vs $3.00/M(未命中);程式設計負載快取命中率 90%+(來源:Moonshot 官方)。
  • 自部署門檻:官方建議 64 卡及以上超節點;OpenRouter 上已有 7 家服務商託管 K3(來源:Moonshot/OpenRouter)。

FAQ 精選:

  • Q:Kimi K3 真的是開源模型嗎?A:嚴格來說不是。屬於開放權重模型:權重、技術報告和部分 Infra 公開,訓練資料與完整訓練程式碼未公開,不符合 OSI 開源定義。
  • Q:Kimi K3 可以免費商用嗎?A:絕大多數商業場景不受限制;Model-as-a-Service 年收入超 2000 萬美元或月活超 1 億須滿足授權特定條款。
  • Q:Kimi K3 需要多少顯示卡才能自己部署?A:官方建議 64 卡及以上超節點;個人與大部分企業更現實的方式是官方 API 或 OpenRouter。
  • Q:Kimi K3 的效能到底強不強?A:開放權重陣營綜合能力最強,Artificial Analysis 全球第 3;但成本高於 GLM-5.2,非性價比最優選。
  • Q:Kimi K3 和 Kimi K2 有什麼差別?A:K3 參數約為 K2.5 的 3 倍,新增 AttnRes 與 Per-Head Muon,上下文與多模態大幅提升;授權新增 MaaS 收入門檻。

下列為撰寫時依據的公開來源;若上游更新,請以原文為準。

https://api.moonshot.ai/v1

https://huggingface.co/moonshotai

https://github.com/moonshotai/FlashKDA

三天後,阿里巴巴(月之暗面投資方之一)發布 24 兆參數的 Qwen3.8-Max-Preview,被外界普遍解讀為對 K3 的直接回應——國產大模型競爭正式進入「3T 俱樂部」階段。比起糾結「開源」標籤,更值得投入精力的是讀懂授權邊界、建立分層路由,並把 API 推理與本地 Agent 編排分層部署。

替代方案的真實缺點(工程視角):① 在 16GB 筆電上硬跑 Kimi K3 權重下載(1.56TB)加本地推理嘗試,磁碟與記憶體瞬間飽和,fallback 路由再聰明也救不了硬體天花板;② 筆電合蓋 sleep 後 OAuth 過期、長時 Agent 批次任務中斷,週榜上的「最強開放權重模型」無法完成 7×24 流水線;③ 為驗證 K3 Agent 工作流一次性買斷高配 Mac Studio,3 個月閒置折舊遠高於按週租用——且 3T 級推理應走 API,本地只需穩定 macOS Agent 編排面。

對需要獨佔 Apple Silicon、7×24 線上、按天/週/月彈性擴容、在 macOS 宿主上穩定跑 Kimi K3 API 驅動的 Agent(Hermes、OpenClaw、Kilo Code 等)與 iOS CI 同機驗證的開發者與 AI 自動化團隊,NOVAKVM 的 Mac Mini 雲端裸金屬租用通常是更優解:六地節點、高記憶體檔位、SSH 直連,把 Moonshot API 推理與裸金屬 macOS 執行面分層——雲端 K3 呼叫 + 本地 Agent 編排,避免自部署 64 卡叢集與筆電 sleep 中斷的雙重陷阱。請在 NOVAKVM 定價頁 對照 M4 Pro 與儲存擴容,在 訂購頁 拉起試驗機;遠端連線見 說明中心