若你是AI 开发者、技术选型负责人或关注国产开源大模型的从业者,2026 年 7 月 16 日深夜月之暗面(Moonshot AI)在 API 文档顶部悄然挂出「🎉 Kimi K3 已上线!」横幅——没有大型发布会,却发布了2.8 万亿(2.8T)参数、迄今全球最大开源 AI 模型。本文覆盖MoE 896 专家/16 活跃、100 万 token 上下文与原生视觉能力、KDA/AttnRes/Stable LatentMoE 三大架构创新、与 Claude Fable 5/GPT-5.6 Sol 的完整基准对照、$3/$15 定价与国内 ¥20/¥100 费率、四种立即接入方式、7 月 27 日 Hugging Face 权重开源承诺,以及 6 条 FAQ。节点方案见 定价页。
[ SECTION_01 ] // OVERVIEW Kimi K3 是什么?2.8T 静默发布与核心规格一览
Kimi K3 是目前全球参数规模最大的开源 AI 模型——2.8T 参数,超越此前纪录保持者 DeepSeek V4 Pro(1.6T)近 75%,是小米开源模型(1.02T)的 2.7 倍,是阿里(397B)的 7 倍有余。它采用稀疏混合专家(MoE)架构,推理时从 896 个专家中激活 16 个;配合 100 万 token 超长上下文(约等于一次性读完 5 本《红楼梦》全文)以及原生视觉理解能力,专为复杂编程、长文档推理与知识工作场景设计。
一句话总结:Kimi K3 是一个开源的、可原生理解图像与视频的、拥有超长记忆的「重量级编程 AI」,价格比 Claude Opus 4.8 便宜约 40%,且完整权重将于 7 月 27 日对外开源。
对开发者与团队而言,K3 落地前需正视三大痛点:
- 本地部署门槛极高:2.8T 参数意味着生产级自托管需 64 张以上加速卡的超节点配置,消费级硬件无法承载——权重开源不等于「笔记本可跑」。
- 基准数据尚待独立复现:月之暗面自报成绩使用了 Kimi Code、Codex、Claude Code 等不同推理 harness,第三方复现仍在进行中,不宜仅凭单表做采购决策。
- 并非全场景最优:FrontierSWE、Terminal Bench 2.1 等单项仍被 Claude Fable 5 或 GPT-5.6 Sol 领先;选型须按具体任务矩阵而非「参数最大」一刀切。
| 维度 | Kimi K3 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T) |
| 架构 | KDA + AttnRes + Stable LatentMoE |
| MoE 稀疏度 | 896 专家,每次激活 16 个(1.8%) |
| 上下文窗口 | 1,048,576 token(1M) |
| 输入模态 | 文本、图像、视频 |
| API 模型 ID | kimi-k3 |
| 开源权重 | 2026 年 7 月 27 日 Hugging Face |
静默发布与 2.8T 体量形成鲜明对比——这不是参数堆砌的面子工程,而是商业化爆发期的技术主权宣示。
[ SECTION_02 ] // ARCHITECTURE DeepSeek 冲击后的反击:商业背景与三大架构创新
月之暗面在过去 18 个月经历了 DeepSeek 崛起带来的巨大冲击,市场份额一度大幅缩水。K3 发布堪称一次漂亮的反击,且发布时间恰在 2026 世界人工智能大会(WAIC)开幕前夜,战略信号极强:
- 过去 12 个月里,Kimi 系列模型有 9 个月占据开源模型规模上限的位置;
- 截至 2026 年 6 月,月之暗面 ARR(年度经常性收入)已突破 3 亿美元;
- 今年内已完成第 6 轮融资,投前估值达 315 亿美元;
- API 收入占整体收入 七成以上,海外付费用户增长 400%。
Kimi Delta Attention(KDA)—— 重新设计注意力机制
传统 Transformer 全注意力在长上下文下计算量呈平方级增长,100 万 token 时 KV 缓存内存消耗是毁灭性的。KDA 是混合线性注意力机制:
- 以 3:1 比例交替使用线性注意力层与全注意力层——3 个线性层处理局部序列(计算廉价),1 个全注意力层保留全局信息流;
- KV 缓存内存减少高达 75%;
- 百万 token 上下文下,解码速度提升高达 6.3 倍;
- 在短上下文、长上下文和强化学习扩展三种场景中,均超越纯全注意力基线。
Attention Residuals(AttnRes)—— 解决深度信息丢失
- 标准残差连接会将信息沿深度均匀积累,导致早期层关键表征在深层被稀释;
- AttnRes 引入选择性检索——模型可跨越深度直接拉取更早层的高价值表征;
- 月之暗面报告约 25% 训练效率提升,额外计算开销不足 2%。
Stable LatentMoE —— 超高稀疏度的稳定训练
Kimi K3 共 896 个专家、每次推理激活 16 个,稀疏度达 1.8%。Moonshot 配套技术包括 Quantile Balancing(从路由器得分分位数推导专家分配)、Per-Head Muon(每个注意力头独立优化)、Sigmoid Tanh Unit(SiTU)与 Gated MLA。综合架构创新,K3 相较 Kimi K2 整体扩展效率提升约 2.5 倍。
| 技术 | 作用 |
|---|---|
| Quantile Balancing | 从路由器得分分位数直接推导专家分配,消除启发式超参 |
| Per-Head Muon | 针对每个注意力头独立优化,使大规模训练更自适应 |
| SiTU | 改进激活函数控制 |
| Gated MLA | 提升注意力选择性 |
[ SECTION_03 ] // BENCHMARKS 基准测试全表:K3 强在哪?定价怎么比?
月之暗面自报核心基准数据如下(含 GLM-5.2 对照):
| 基准测试 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 12.9 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 91.2 |
| MMMU-Pro(视觉) | 81.6 | 81.2 | 83.0 | 78.9 | — |
| OmniDocBench(文档理解) | 91.1 | 89.8 | 85.8 | 87.9 | — |
解读重点:编程长任务(SWE Marathon)K3 以 42.0 大幅领先;Program Bench 微幅第一(77.8 vs 76.8);FrontierSWE 由 Fable 5 领跑(86.6);文档理解 OmniDocBench K3 第一(91.1),体现视觉 + 长上下文协同优势。在 Artificial Analysis Intelligence Index v4.1 中,K3 以 57.1 分排名第四,紧随 Claude Fable 5(59.9)和 GPT-5.6 Sol(58.9)之后,与第一梯队差距仅 2.8 分。
注意事项:上述基准为月之暗面自报数据,不同模型使用了各自的推理 harness(K3 用 Kimi Code,GPT 用 Codex,Claude 用 Claude Code),独立第三方复现工作仍在进行中。请将其视为方向性参考,而非最终定论。
| 模型 | 输入 | 输出 | 缓存命中输入 | 上下文 |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00(促销 $2) | $15.00(促销 $10) | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
K3 标准价与 Claude Sonnet 5 持平($3/$15),但提供 5 倍上下文;缓存命中低至 $0.30/M(标准价 1/10),月之暗面报告编程场景缓存命中率超过 90%。国内 API 定价:¥20/M(输入)、¥100/M(输出)、缓存命中 ¥2/M;消费者版在 kimi.com 免费账号即可使用,预付费套餐 ¥199 起(优惠截至 8 月 11 日)。
[ SECTION_04 ] // ACCESS 四种接入方式、六步落地清单与场景选型矩阵
Kimi K3 现已可通过以下四种方式立即调用:
- 方法一 — Kimi 网页/App:访问 kimi.com,注册账号(支持 Google 账号),K3 默认以最大推理力度运行,无需信用卡。
- 方法二 — 官方 API:在 platform.kimi.ai 获取 API Key,模型 ID 为
kimi-k3,OpenAI 兼容接口。 - 方法三 — OpenRouter:模型 ID
moonshotai/kimi-k3,Moonshot 官方定价,无额外加价,完整 1M 上下文。 - 方法四 — 等 7 月 27 日开源权重:完整模型权重将于 Hugging Face 开放,生产级部署需 64 张以上加速卡超节点。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "帮我分析这段代码..."}]
)
- 明确任务边界:对照上文基准矩阵,确认你的场景属于 SWE Marathon 长代码、Repo 级修 Bug、终端 Agent 还是文档多模态——避免「参数最大」误选。
- 注册并验证 kimi.com:用 Google 账号快速注册,在 Web 端试跑典型 Prompt,确认视觉与长上下文是否符合预期。
- 申请 Moonshot API Key:登录 platform.kimi.ai,创建 Key 并设置用量告警;国内用户核对 ¥20/¥100/¥2 费率与 ¥199 预付费套餐。
- 接入 OpenAI 兼容 SDK:将
base_url指向https://api.moonshot.ai/v1,模型 ID 固定kimi-k3;若已有 OpenRouter 账号,可直接切换moonshotai/kimi-k3。 - 启用缓存策略:编程工作流重复上下文比例高,Moonshot 报告缓存命中率超 90%——按 Mooncake 分推理架构设计 Prompt 结构,降低有效输入成本至约 $0.55/M。
- 固定工程验证环境:把 Xcode 构建、Fastlane 与多模型 Agent 路由迁到7×24 稳定 Apple Silicon 宿主,API 试跑与 iOS CI/CD 同机验证;K3 自托管需等 7 月 27 日权重且需 64+ GPU,不应把 iOS 发布节奏押在本地推理集群上——详见下文 NOVAKVM 方案。
| 场景 | 推荐模型 | 原因 |
|---|---|---|
| 持续性长代码任务(SWE Marathon 类) | Kimi K3 | 基准第一,上下文最长 |
| 复杂 Repo 级别修 Bug | Claude Fable 5 | FrontierSWE 大幅领先 |
| 终端/工具链密集型 Agent | GPT-5.6 Sol | Terminal Bench 2.1 领先 |
| 超长文档分析/多模态文档理解 | Kimi K3 | OmniDocBench 第一,原生视觉 + 1M 上下文 |
| 成本敏感场景 | DeepSeek V4 Pro | 输出仅 $3.48/M,远低于 K3 |
| 开源自部署(近期) | Kimi K3(7/27 后) | 最强开源权重,2.8T 新标杆 |
[ SECTION_05 ] // OPEN_SOURCE 7 月 27 日开源承诺:权重开放后意味着什么?
月之暗面在官方 WeChat 公告中明确承诺:2026 年 7 月 27 日开放完整模型权重。一旦权重开放,Kimi K3 将成为迄今参数最大的可下载开源模型、首个超 2 万亿参数级别的开源权重,以及开源社区训练/微调基座新标杆。Hugging Face 上将出现 MXFP4/NVFP4 量化版本,vLLM、SGLang 等主流推理框架预计第一时间支持。
需再次强调:2.8T 权重不等于消费级本地部署。生产级推理需 64 张以上加速卡(如 NVIDIA H100)的超节点配置——这是面向推理服务商与资源充足研究实验室的模型,而非笔记本 LLM。
| 时间 | 事件 |
|---|---|
| 2026 年 7 月 16 日 | Kimi K3 API 静默上线,文档横幅与定价页同步发布 |
| 2026 年 7 月 17–20 日 | WAIC 上海(世界人工智能大会),预计更多发布与生态合作 |
| 2026 年 7 月 27 日 | 完整模型权重于 Hugging Face 开放下载 |
| 2026 年 8 月 11 日 | ¥199 预付费套餐优惠截止 |
Kimi K3 代表了中国 AI 开源生态的新信号:不再是「以低价换市场」,而是在真正挑战智能前沿。关注节点:7 月 17–20 日 WAIC → 7 月 27 日权重开源。
[ SECTION_06 ] // DATA 可引用技术数据、FAQ 与总结
- 参数规模:2.8T 总参数,896 专家 MoE、每次激活 16 个,稀疏度 1.8%。
- KDA 效率:3:1 线性/全注意力交替,KV 缓存减少 75%,1M 上下文解码加速 6.3 倍。
- AttnRes:训练效率提升约 25%,额外计算开销 <2%。
- 扩展效率:相较 Kimi K2 整体扩展效率提升约 2.5 倍。
- 综合智能指数:Artificial Analysis Intelligence Index v4.1 得分 57.1,全球第四。
- API 定价:$3/$15 per 1M tokens,缓存命中 $0.30;国内 ¥20/¥100/¥2。
FAQ 精选:
- Kimi K3 可以免费使用吗? 可以——kimi.com 免费账号即可体验,默认最大推理力度。API 调用需付费 Key,按 $3/$15 per 1M tokens 计费。
- 能在本地跑 Kimi K3 吗? 7 月 27 日前不行;权重开放后生产级推理仍需 64+ 加速卡超节点,消费级硬件不现实。Mac Mini 或笔记本无法承载 2.8T 推理。
- K3 和 DeepSeek V4 Pro 怎么比? K3 参数近翻倍(2.8T vs 1.6T)、上下文大得多(1M vs 128K)、多项基准更强;但 DeepSeek V4 Pro 输出仅 $3.48/M,成本显著更低。
- 1M token 上下文真的有用吗? 对整库代码分析、长篇论文/法律文档端到端处理、多轮 Agent 长记忆尤其有价值;K3 按 flat 定价无长度附加费,实际可用满窗口。
- 基准数据可信吗? 月之暗面自报且 harness 不统一,独立复现进行中。建议结合你的真实任务做 A/B,而非仅凭公开表格采购。
- 低/高推理力度模式何时上线? Moonshot 表示
low与high模式将在后续更新推出;当前仅max可用。
Kimi K3 不是参数堆砌的面子工程:KDA、AttnRes、Stable LatentMoE 做了真正的工程创新,在编程长任务与文档理解等关键赛道对标乃至超越部分闭源旗舰,定价合理,且承诺完整开源。它未必赢得每一项 benchmark——Claude Fable 5 与 GPT-5.6 Sol 在特定 coding 与 reasoning 任务仍领先——但在长程 coding 与文档理解上表现突出,并以 1M token 上下文和 Sonnet 级定价形成独特组合。
以下为主要参考来源,发版或入库后请再次打开链接核对:
OpenRouter:moonshotai/kimi-k3 模型页
Artificial Analysis Intelligence Index
South China Morning Post: Moonshot AI releases Kimi K3
VentureBeat: Kimi K3 open-source LLM coverage
若你把 iOS 应用测试、多模型 Agent 路由与 API 集成验证完全押在 2.8T 本地推理集群或尚未开放的 Hugging Face 权重上,64+ GPU 超节点成本与 7 月 27 日前的时间空窗都会直接打乱工程节奏;纯 API 试跑也无法替代稳定 7×24 的 Xcode 同机 CI 与 Apple Silicon 原生构建链。
若你需要在 Kimi K3 接入窗口期固定 Apple Silicon 执行面、稳定 iOS CI/CD 与 AI Agent 生产验证——把 Xcode 构建、Fastlane 与多模型 Agent 自动化迁到独占裸金属 Mac Mini,用于调用 K3 API 的工程验证而非本地跑 2.8T 权重——通常比自建 GPU 超节点或依赖不确定的本地推理更可控:NOVAKVM 提供多区域 Mac Mini M4 / M4 Pro 弹性租期,固定带宽与默认 SSH 访问,适合 iOS 工程与 AI Agent 自动化同机验证。方案见 定价页,下单见 订购页,部署问题见 帮助中心。