Kimi K3 全面开源:
2.8万亿参数、百万上下文,月之暗面这次放了什么大招

若你是正在评估 Kimi K3 接入、自部署或商用合规的 AI 开发者与企业技术负责人,7月27日晚月之暗面(Moonshot AI)发布的完整权重与技术报告,很可能改写你对「国产 3T 级模型」的认知边界。Kimi K3 拥有 2.8 万亿总参数、100 万 token 上下文,并同步开源 MoonEP、FlashKDA、AgentEnv 三项核心基础设施——距 API 首发仅 11 天。本文覆盖时间线、架构创新(KDA/AttnRes/Per-Head Muon)、Infra 开源、SWE-bench 与 Artificial Analysis 基准、开放权重许可证两道商业门槛、API 定价与六步接入清单;可与 7月16日 K3 首发评测蒸馏门争议篇OpenRouter 7月榜 交叉阅读。定价见 定价页

7月27日晚 23 点左右,月之暗面正式发布 Kimi K3 完整模型权重与技术报告,权重文件在 Hugging Face 上体积约 1.56TB,上线半小时内即登顶趋势榜第一。这是全球首个被完整开放的 3 万亿参数级别模型——但官方从未使用「open source」,一直采用「open weight(开放权重)」表述。📌

  • 概念混淆:国内媒体普遍翻译为「开源」,但 OSI 标准下的开源需公开训练数据与完整训练代码;K3 仅公开权重、技术报告与推理 Infra,训练管线不可复现。
  • 许可证盲区:K3 许可证新增两道 K2 系列没有的商业门槛——Model-as-a-Service 年收入超 2000 万美元须另行签约;月活超 1 亿或月收入超 2000 万美元须显著展示「Kimi K3」字样。
  • 自部署幻觉:2.8T 参数、896 专家 MoE 决定 K3 几乎不可能在消费级硬件运行;官方建议 64 卡及以上超节点,个人开发者更现实的路径是 API 或 OpenRouter。
  • 基准误读:厂商自报与独立第三方复测差异大;SWE-bench Verified 上 K3 为 93.4%,仍低于 Claude Opus 5(97%)与 GPT-5.6 Sol(96.2%),但已是开源阵营最强。
  • 成本错配:K3 每任务成本约 $0.95,比 GLM-5.2(约 $0.47)更贵——它是开源能力天花板,而非性价比最优选。
  • 地缘变量:权重开源前数天,美方指控月之暗面「工业化蒸馏」Anthropic Fable 模型训练 K3 并威胁制裁;中国商务部 7 月 28 日公开回应指责「AI 霸权主义」。

核心结论:Kimi K3 是开放权重阵营的能力天花板,不是传统意义的开源项目;对绝大多数中小团队可正常商用,但若你的商业模式是与月之暗面竞争的模型即服务,许可证第一道门槛是法务红线。

11 天从 API 到权重开源时间线:

  • 7月16日夜(WAIC 2026 前夜):Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 Kimi API 首发,仅限在线调用,权重尚未公开。
  • 7月17日:行业密集分析架构;新华社报道称其为「目前全球参数最大的开源模型」。
  • 7月22日–23日:中美「模型蒸馏」争端升级;美国白宫科技顾问 Michael Kratsios 指控月之暗面对 Anthropic Fable 模型进行「大规模、隐蔽的工业化蒸馏」。
  • 7月27日晚23点:正式发布 K3 完整权重、技术报告,并开源 MoonEP、AgentEnv(FlashKDA 此前已开源)。
  • 7月28日:中国商务部公开回应;国内多家媒体跟进报道开源细节。

Kimi K3 在架构上重构了深度学习沿用多年的三大传统组件——注意力机制、残差连接、优化器,这也是它区别于「简单堆参数」的关键。

Kimi K3 核心参数一览
项目 参数
总参数量2.8 万亿(2.8T)
激活参数量约 1040 亿
架构类型混合专家模型(MoE)
专家配置896 个路由专家,每 token 激活 16 个(另有共享专家)
注意力机制Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA)
上下文窗口100 万 token
多模态能力原生视觉理解(ViT-V2,27层)
权重格式MXFP4 权重 + MXFP8 激活(SFT 阶段起量化感知训练)
权重体积约 1.56TB(Hugging Face)
License自定义许可证(官方称 open weight,非 open source)

Kimi Delta Attention(KDA):传统 Gated DeltaNet 使用标量级遗忘门,KDA 改为逐通道门控——每个特征维度拥有独立衰减率,某些特征长期保留、另一些快速遗忘。采用 chunkwise DPLR 公式实现线性时间递归,K3 将 KDA 与少量 Gated MLA 全局注意力层交替混合,支撑 100 万 token 上下文同时把 KV Cache 开销压到极低。

Attention Residuals(AttnRes):传统残差连接逐层均匀累加,深层网络早期信息易被稀释。AttnRes 改为选择性、依据输入动态聚合前面所有层的输出——每层仅新增一个 RMSNorm 和一个伪查询向量,带来约 25% 训练效率提升,代价不到 2%。

Per-Head Muon:在 Muon 优化器基础上做逐注意力头独立优化,让每个头拥有更自适应的收敛路径。纯训练期技术,API 调用无感知,但堆叠细节让 K3 以更少激活参数打出接近顶尖闭源模型效果。

Stable LatentMoE:896 选 16 的稀疏路由(稀疏度约 1.8%),配合共享专家保证基础能力;采用 Quantile Balancing 均衡策略,配合 MoonEP 从数学上证明每个计算节点冗余专家数的理论上界。

月之暗面这次没有只发权重文件,而是把支撑 K3 训练效率与稳定性的三项关键基础设施技术一并开源。

三大开源 Infra 技术
技术 定位 关键能力
MoonEP 超大规模细粒度 MoE 高性能通信库 临时复制过载专家保证每节点均等 token 数;证明冗余专家数理论上界
FlashKDA 基于 NVIDIA CUTLASS 的 KDA 高性能算子(此前已开源) H20 上 prefill 比 flash-linear-attention 基线快 1.72–2.22 倍;可作为 chunk_kda 直接替代后端
AgentEnv 与 KVCache.ai 联合开发的 Agent 沙箱(Firecracker microVM) 大规模并行 Agent RL 训练;官方披露 checkpoint 延迟 133ms、恢复 49ms、内存超分最高 6.5 倍(尚未第三方独立复现)

SWE-bench Verified(独立复测,Vals AI,截至 2026 年 7 月):

SWE-bench Verified 独立复测对比
模型 分数 发布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Artificial Analysis 智能指数(max 推理档):Claude Fable 5 为 60,GPT-5.6 Sol 为 59,Kimi K3 约 57(全球第 3,开源模型第 1),GLM-5.2 为 51,DeepSeek V4 Pro 为 44。K3 目前在 Arena.ai 的 Frontend Code Arena 榜单排名第一。每任务成本约 $0.95,比 Claude Fable 5(约 $2.4)便宜约 60%,但比 GLM-5.2(约 $0.47)更贵。

月之暗面官方材料从未使用「open source」,一直采用「open weight」表述。许可证是一份完全自定义文件,包含两道商业门槛:

  1. Model-as-a-Service 收入门槛:若被许可方运营模型即服务业务,且连续 12 个月内该业务累计收入超过 2000 万美元,须与月之暗面另行签署商业协议。
  2. 规模展示门槛:若产品月活超过 1 亿,或月收入超过 2000 万美元,须在产品界面显著展示「Kimi K3」字样。

API 定价(OpenAI SDK 兼容,模型 ID kimi-k3):

Kimi K3 API 定价(每百万 token)
Token 类型 价格
输入(缓存命中)$0.30
输入(缓存未命中)$3.00
输出(含推理过程)$15.00

由于 Mooncake 分离式推理架构在典型编程类工作负载上缓存命中率可达 90% 以上,实际大部分调用成本更接近 $0.30 档,而非 $3 表头价格。

六步 Kimi K3 接入清单(开发者 / 小团队 / 企业通用):

  1. 明确接入路径:评估自部署(64 卡超节点)vs 官方 API vs OpenRouter 等第三方托管;绝大多数团队应选 API 路径。可参考 OpenRouter 接入教程 做多 Provider 抽象。
  2. 审阅许可证:下载 Hugging Face 上的 LICENSE 全文,确认你的商业模式不触发 Model-as-a-Service 收入门槛或规模展示门槛;法务团队重点审查「与月之暗面竞争的推理服务」场景。
  3. 配置 API 客户端:将 base URL 设为 Moonshot 官方端点,模型 ID 设为 kimi-k3;现有 OpenAI SDK 项目通常只需改 base URL 与 API Key。
  4. 启用缓存感知计费:对编程类 Agent 工作负载设计 prompt 缓存策略,利用 Mooncake 高命中率把实际输入成本压向 $0.30/M 档。
  5. 建立分层路由:日常 Agentic Coding 用 K3 或 DeepSeek V4 Flash 跑量;卡住的复杂步骤切 Claude Opus 5 或 GPT-5.6 Sol,避免单一模型账单失控。参见 7 月 OpenRouter 分层选型
  6. 固化 7×24 Agent 运行环境:长时 Agent 编排、多模型网关须跑在常驻 macOS 节点而非合盖即断的笔记本;详见 帮助中心订购页
kimi-k3-api-example.py
# OpenAI SDK 兼容调用示例(发布前请以官方文档核对端点与模型 ID)
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention in one paragraph."}]
)
print(response.choices[0].message.content)

  • 总参数量:2.8 万亿,激活约 1040 亿;全球首个完整开放的 3T 级模型(来源:月之暗面技术报告)。
  • 权重体积:约 1.56TB,Hugging Face 上线半小时登顶趋势榜第一(来源:Hugging Face)。
  • SWE-bench Verified:K3 独立复测 93.4%,开源阵营最强,仍低于 Claude Opus 5 的 97%(来源:Vals AI,2026 年 7 月)。
  • Artificial Analysis 智能指数:K3 max 档约 57,全球第 3、开源第 1(来源:Artificial Analysis)。
  • FlashKDA 加速:NVIDIA H20 上 prefill 比 flash-linear-attention 基线快 1.72–2.22 倍(来源:Moonshot GitHub)。
  • API 缓存命中价:输入 $0.30/M(缓存命中)vs $3.00/M(未命中);编程负载缓存命中率 90%+(来源:Moonshot 官方)。
  • 自部署门槛:官方建议 64 卡及以上超节点;OpenRouter 上已有 7 家服务商托管 K3(来源:Moonshot / OpenRouter)。

FAQ 精选:

  • Q:Kimi K3 真的是开源模型吗?A:严格来说不是。属于开放权重模型:权重、技术报告和部分 Infra 公开,训练数据与完整训练代码未公开,不符合 OSI 开源定义。
  • Q:Kimi K3 可以免费商用吗?A:绝大多数商业场景不受限制;Model-as-a-Service 年收入超 2000 万美元或月活超 1 亿须满足许可证特定条款。
  • Q:Kimi K3 需要多少显卡才能自己部署?A:官方建议 64 卡及以上超节点;个人和大部分企业更现实的方式是官方 API 或 OpenRouter。
  • Q:Kimi K3 的性能到底强不强?A:开源阵营综合能力最强,Artificial Analysis 全球第 3;但成本高于 GLM-5.2,非性价比最优选。
  • Q:Kimi K3 和 Kimi K2 有什么区别?A:K3 参数约为 K2.5 的 3 倍,新增 AttnRes 与 Per-Head Muon,上下文与多模态大幅提升;许可证新增 MaaS 收入门槛。

下列为撰写时依据的公开来源;若上游更新,请以原文为准。

https://api.moonshot.ai/v1

https://huggingface.co/moonshotai

https://github.com/moonshotai/FlashKDA

三天后,阿里巴巴(月之暗面投资方之一)发布 24 万亿参数的 Qwen3.8-Max-Preview,被外界普遍解读为对 K3 的直接回应——国产大模型竞争正式进入「3T 俱乐部」阶段。比起纠结「开源」标签,更值得投入精力的是读懂许可证边界、建立分层路由,并把 API 推理与本地 Agent 编排分层部署。

替代方案的真实缺点(工程视角):① 在 16GB 笔电上硬跑 Kimi K3 权重下载(1.56TB)加本地推理尝试,磁盘与内存瞬间饱和,fallback 路由再聪明也救不了硬件天花板;② 笔电合盖 sleep 后 OAuth 过期、长时 Agent 批任务中断,周榜上的「最强开源模型」无法完成 7×24 流水线;③ 为验证 K3 Agent 工作流一次性买断高配 Mac Studio,3 个月闲置折旧远高于按周租用——且 3T 级推理应走 API,本地只需稳定 macOS Agent 编排面。

对需要独占 Apple Silicon、7×24 在线、按天/周/月弹性扩容、在 macOS 宿主上稳定跑 Kimi K3 API 驱动的 Agent(Hermes、OpenClaw、Kilo Code 等)与 iOS CI 同机验证的开发者与 AI 自动化团队,NOVAKVM 的 Mac Mini 云端裸金属租赁通常是更优解:六地节点、高内存档位、SSH 直连,把 Moonshot API 推理与裸金属 macOS 执行面分层——云端 K3 调用 + 本地 Agent 编排,避免自部署 64 卡集群与笔记本 sleep 中断的双重陷阱。请在 NOVAKVM 定价页 对照 M4 Pro 与存储扩容,在 订购页 拉起试验机;远程会话见 帮助中心