Kimi K3 深度评测:2.8 万亿参数,
国产开源大模型新纪录

若你是AI 开发者、技术选型负责人或关注国产开源大模型的从业者,2026 年 7 月 16 日深夜月之暗面(Moonshot AI)在 API 文档顶部悄然挂出「🎉 Kimi K3 已上线!」横幅——没有大型发布会,却发布了2.8 万亿(2.8T)参数、迄今全球最大开源 AI 模型。本文覆盖MoE 896 专家/16 活跃、100 万 token 上下文与原生视觉能力、KDA/AttnRes/Stable LatentMoE 三大架构创新、与 Claude Fable 5/GPT-5.6 Sol 的完整基准对照、$3/$15 定价与国内 ¥20/¥100 费率、四种立即接入方式、7 月 27 日 Hugging Face 权重开源承诺,以及 6 条 FAQ。节点方案见 定价页

Kimi K3 是目前全球参数规模最大的开源 AI 模型——2.8T 参数,超越此前纪录保持者 DeepSeek V4 Pro(1.6T)近 75%,是小米开源模型(1.02T)的 2.7 倍,是阿里(397B)的 7 倍有余。它采用稀疏混合专家(MoE)架构,推理时从 896 个专家中激活 16 个;配合 100 万 token 超长上下文(约等于一次性读完 5 本《红楼梦》全文)以及原生视觉理解能力,专为复杂编程、长文档推理与知识工作场景设计。

一句话总结:Kimi K3 是一个开源的、可原生理解图像与视频的、拥有超长记忆的「重量级编程 AI」,价格比 Claude Opus 4.8 便宜约 40%,且完整权重将于 7 月 27 日对外开源。

对开发者与团队而言,K3 落地前需正视三大痛点:

  • 本地部署门槛极高:2.8T 参数意味着生产级自托管需 64 张以上加速卡的超节点配置,消费级硬件无法承载——权重开源不等于「笔记本可跑」。
  • 基准数据尚待独立复现:月之暗面自报成绩使用了 Kimi Code、Codex、Claude Code 等不同推理 harness,第三方复现仍在进行中,不宜仅凭单表做采购决策。
  • 并非全场景最优:FrontierSWE、Terminal Bench 2.1 等单项仍被 Claude Fable 5 或 GPT-5.6 Sol 领先;选型须按具体任务矩阵而非「参数最大」一刀切。
Kimi K3 核心规格速览
维度 Kimi K3
总参数量 2.8 万亿(2.8T)
架构 KDA + AttnRes + Stable LatentMoE
MoE 稀疏度 896 专家,每次激活 16 个(1.8%)
上下文窗口 1,048,576 token(1M)
输入模态 文本、图像、视频
API 模型 ID kimi-k3
开源权重 2026 年 7 月 27 日 Hugging Face

静默发布与 2.8T 体量形成鲜明对比——这不是参数堆砌的面子工程,而是商业化爆发期的技术主权宣示。

月之暗面在过去 18 个月经历了 DeepSeek 崛起带来的巨大冲击,市场份额一度大幅缩水。K3 发布堪称一次漂亮的反击,且发布时间恰在 2026 世界人工智能大会(WAIC)开幕前夜,战略信号极强:

  • 过去 12 个月里,Kimi 系列模型有 9 个月占据开源模型规模上限的位置;
  • 截至 2026 年 6 月,月之暗面 ARR(年度经常性收入)已突破 3 亿美元
  • 今年内已完成第 6 轮融资,投前估值达 315 亿美元
  • API 收入占整体收入 七成以上,海外付费用户增长 400%

Kimi Delta Attention(KDA)—— 重新设计注意力机制

传统 Transformer 全注意力在长上下文下计算量呈平方级增长,100 万 token 时 KV 缓存内存消耗是毁灭性的。KDA 是混合线性注意力机制:

  • 3:1 比例交替使用线性注意力层与全注意力层——3 个线性层处理局部序列(计算廉价),1 个全注意力层保留全局信息流;
  • KV 缓存内存减少高达 75%
  • 百万 token 上下文下,解码速度提升高达 6.3 倍
  • 在短上下文、长上下文和强化学习扩展三种场景中,均超越纯全注意力基线。

Attention Residuals(AttnRes)—— 解决深度信息丢失

  • 标准残差连接会将信息沿深度均匀积累,导致早期层关键表征在深层被稀释;
  • AttnRes 引入选择性检索——模型可跨越深度直接拉取更早层的高价值表征;
  • 月之暗面报告约 25% 训练效率提升,额外计算开销不足 2%

Stable LatentMoE —— 超高稀疏度的稳定训练

Kimi K3 共 896 个专家、每次推理激活 16 个,稀疏度达 1.8%。Moonshot 配套技术包括 Quantile Balancing(从路由器得分分位数推导专家分配)、Per-Head Muon(每个注意力头独立优化)、Sigmoid Tanh Unit(SiTU)与 Gated MLA。综合架构创新,K3 相较 Kimi K2 整体扩展效率提升约 2.5 倍

Stable LatentMoE 配套技术对照
技术 作用
Quantile Balancing 从路由器得分分位数直接推导专家分配,消除启发式超参
Per-Head Muon 针对每个注意力头独立优化,使大规模训练更自适应
SiTU 改进激活函数控制
Gated MLA 提升注意力选择性

月之暗面自报核心基准数据如下(含 GLM-5.2 对照):

Kimi K3 与闭源/开源旗舰基准对照(月之暗面自报,2026-07-16)
基准测试 Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GLM-5.2
DeepSWE 67.5 70.0 73.0 59.0 46.2
Program Bench 77.8 76.8 77.6 71.9 63.7
Terminal Bench 2.1 88.3 84.6 88.8 84.6 82.7
FrontierSWE 81.2 86.6 71.3 66.7 67.3
SWE Marathon 42.0 35.0 39.0 40.0 13.0
BrowseComp 91.2 88.0 90.4 84.3
Automation Bench 30.8 29.1 29.7 27.2 12.9
GPQA-Diamond 93.5 92.6 94.1 91.0 91.2
MMMU-Pro(视觉) 81.6 81.2 83.0 78.9
OmniDocBench(文档理解) 91.1 89.8 85.8 87.9

解读重点:编程长任务(SWE Marathon)K3 以 42.0 大幅领先;Program Bench 微幅第一(77.8 vs 76.8);FrontierSWE 由 Fable 5 领跑(86.6);文档理解 OmniDocBench K3 第一(91.1),体现视觉 + 长上下文协同优势。在 Artificial Analysis Intelligence Index v4.1 中,K3 以 57.1 分排名第四,紧随 Claude Fable 5(59.9)和 GPT-5.6 Sol(58.9)之后,与第一梯队差距仅 2.8 分。

注意事项:上述基准为月之暗面自报数据,不同模型使用了各自的推理 harness(K3 用 Kimi Code,GPT 用 Codex,Claude 用 Claude Code),独立第三方复现工作仍在进行中。请将其视为方向性参考,而非最终定论。

API 定价对照($/M token,2026-07-16)
模型 输入 输出 缓存命中输入 上下文
Kimi K3 $3.00 $15.00 $0.30 1M
Claude Sonnet 5 $3.00(促销 $2) $15.00(促销 $10) 200K
Claude Opus 4.8 $5.00 $25.00 200K
GPT-5.5 $5.00 $30.00 400K
DeepSeek V4 Pro $1.74 $3.48 $0.145 128K
Kimi K2.6 $0.95 $4.00 $0.16 256K

K3 标准价与 Claude Sonnet 5 持平($3/$15),但提供 5 倍上下文;缓存命中低至 $0.30/M(标准价 1/10),月之暗面报告编程场景缓存命中率超过 90%。国内 API 定价:¥20/M(输入)、¥100/M(输出)、缓存命中 ¥2/M;消费者版在 kimi.com 免费账号即可使用,预付费套餐 ¥199 起(优惠截至 8 月 11 日)。

Kimi K3 现已可通过以下四种方式立即调用:

  • 方法一 — Kimi 网页/App:访问 kimi.com,注册账号(支持 Google 账号),K3 默认以最大推理力度运行,无需信用卡。
  • 方法二 — 官方 API:platform.kimi.ai 获取 API Key,模型 ID 为 kimi-k3,OpenAI 兼容接口。
  • 方法三 — OpenRouter:模型 ID moonshotai/kimi-k3,Moonshot 官方定价,无额外加价,完整 1M 上下文。
  • 方法四 — 等 7 月 27 日开源权重:完整模型权重将于 Hugging Face 开放,生产级部署需 64 张以上加速卡超节点。
kimi_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "帮我分析这段代码..."}]
)
  1. 明确任务边界:对照上文基准矩阵,确认你的场景属于 SWE Marathon 长代码、Repo 级修 Bug、终端 Agent 还是文档多模态——避免「参数最大」误选。
  2. 注册并验证 kimi.com:用 Google 账号快速注册,在 Web 端试跑典型 Prompt,确认视觉与长上下文是否符合预期。
  3. 申请 Moonshot API Key:登录 platform.kimi.ai,创建 Key 并设置用量告警;国内用户核对 ¥20/¥100/¥2 费率与 ¥199 预付费套餐。
  4. 接入 OpenAI 兼容 SDK:base_url 指向 https://api.moonshot.ai/v1,模型 ID 固定 kimi-k3;若已有 OpenRouter 账号,可直接切换 moonshotai/kimi-k3
  5. 启用缓存策略:编程工作流重复上下文比例高,Moonshot 报告缓存命中率超 90%——按 Mooncake 分推理架构设计 Prompt 结构,降低有效输入成本至约 $0.55/M。
  6. 固定工程验证环境:把 Xcode 构建、Fastlane 与多模型 Agent 路由迁到7×24 稳定 Apple Silicon 宿主,API 试跑与 iOS CI/CD 同机验证;K3 自托管需等 7 月 27 日权重且需 64+ GPU,不应把 iOS 发布节奏押在本地推理集群上——详见下文 NOVAKVM 方案。
Kimi K3 横向场景选型矩阵
场景 推荐模型 原因
持续性长代码任务(SWE Marathon 类) Kimi K3 基准第一,上下文最长
复杂 Repo 级别修 Bug Claude Fable 5 FrontierSWE 大幅领先
终端/工具链密集型 Agent GPT-5.6 Sol Terminal Bench 2.1 领先
超长文档分析/多模态文档理解 Kimi K3 OmniDocBench 第一,原生视觉 + 1M 上下文
成本敏感场景 DeepSeek V4 Pro 输出仅 $3.48/M,远低于 K3
开源自部署(近期) Kimi K3(7/27 后) 最强开源权重,2.8T 新标杆

月之暗面在官方 WeChat 公告中明确承诺:2026 年 7 月 27 日开放完整模型权重。一旦权重开放,Kimi K3 将成为迄今参数最大的可下载开源模型、首个超 2 万亿参数级别的开源权重,以及开源社区训练/微调基座新标杆。Hugging Face 上将出现 MXFP4/NVFP4 量化版本,vLLM、SGLang 等主流推理框架预计第一时间支持。

需再次强调:2.8T 权重不等于消费级本地部署。生产级推理需 64 张以上加速卡(如 NVIDIA H100)的超节点配置——这是面向推理服务商与资源充足研究实验室的模型,而非笔记本 LLM。

Kimi K3 关键时间节点
时间 事件
2026 年 7 月 16 日 Kimi K3 API 静默上线,文档横幅与定价页同步发布
2026 年 7 月 17–20 日 WAIC 上海(世界人工智能大会),预计更多发布与生态合作
2026 年 7 月 27 日 完整模型权重于 Hugging Face 开放下载
2026 年 8 月 11 日 ¥199 预付费套餐优惠截止

Kimi K3 代表了中国 AI 开源生态的新信号:不再是「以低价换市场」,而是在真正挑战智能前沿。关注节点:7 月 17–20 日 WAIC7 月 27 日权重开源

  • 参数规模:2.8T 总参数,896 专家 MoE、每次激活 16 个,稀疏度 1.8%。
  • KDA 效率:3:1 线性/全注意力交替,KV 缓存减少 75%,1M 上下文解码加速 6.3 倍。
  • AttnRes:训练效率提升约 25%,额外计算开销 <2%。
  • 扩展效率:相较 Kimi K2 整体扩展效率提升约 2.5 倍。
  • 综合智能指数:Artificial Analysis Intelligence Index v4.1 得分 57.1,全球第四。
  • API 定价:$3/$15 per 1M tokens,缓存命中 $0.30;国内 ¥20/¥100/¥2。

FAQ 精选:

  • Kimi K3 可以免费使用吗? 可以——kimi.com 免费账号即可体验,默认最大推理力度。API 调用需付费 Key,按 $3/$15 per 1M tokens 计费。
  • 能在本地跑 Kimi K3 吗? 7 月 27 日前不行;权重开放后生产级推理仍需 64+ 加速卡超节点,消费级硬件不现实。Mac Mini 或笔记本无法承载 2.8T 推理。
  • K3 和 DeepSeek V4 Pro 怎么比? K3 参数近翻倍(2.8T vs 1.6T)、上下文大得多(1M vs 128K)、多项基准更强;但 DeepSeek V4 Pro 输出仅 $3.48/M,成本显著更低。
  • 1M token 上下文真的有用吗? 对整库代码分析、长篇论文/法律文档端到端处理、多轮 Agent 长记忆尤其有价值;K3 按 flat 定价无长度附加费,实际可用满窗口。
  • 基准数据可信吗? 月之暗面自报且 harness 不统一,独立复现进行中。建议结合你的真实任务做 A/B,而非仅凭公开表格采购。
  • 低/高推理力度模式何时上线? Moonshot 表示 lowhigh 模式将在后续更新推出;当前仅 max 可用。

Kimi K3 不是参数堆砌的面子工程:KDA、AttnRes、Stable LatentMoE 做了真正的工程创新,在编程长任务与文档理解等关键赛道对标乃至超越部分闭源旗舰,定价合理,且承诺完整开源。它未必赢得每一项 benchmark——Claude Fable 5 与 GPT-5.6 Sol 在特定 coding 与 reasoning 任务仍领先——但在长程 coding 与文档理解上表现突出,并以 1M token 上下文和 Sonnet 级定价形成独特组合。

以下为主要参考来源,发版或入库后请再次打开链接核对:

月之暗面官方博客:Kimi K3 发布与技术详解

Kimi API Platform 文档与定价

OpenRouter:moonshotai/kimi-k3 模型页

Artificial Analysis Intelligence Index

South China Morning Post: Moonshot AI releases Kimi K3

VentureBeat: Kimi K3 open-source LLM coverage

若你把 iOS 应用测试、多模型 Agent 路由与 API 集成验证完全押在 2.8T 本地推理集群或尚未开放的 Hugging Face 权重上,64+ GPU 超节点成本与 7 月 27 日前的时间空窗都会直接打乱工程节奏;纯 API 试跑也无法替代稳定 7×24 的 Xcode 同机 CI 与 Apple Silicon 原生构建链

若你需要在 Kimi K3 接入窗口期固定 Apple Silicon 执行面、稳定 iOS CI/CD 与 AI Agent 生产验证——把 Xcode 构建、Fastlane 与多模型 Agent 自动化迁到独占裸金属 Mac Mini,用于调用 K3 API 的工程验证而非本地跑 2.8T 权重——通常比自建 GPU 超节点或依赖不确定的本地推理更可控:NOVAKVM 提供多区域 Mac Mini M4 / M4 Pro 弹性租期,固定带宽与默认 SSH 访问,适合 iOS 工程与 AI Agent 自动化同机验证。方案见 定价页,下单见 订购页,部署问题见 帮助中心