Kimi K3 — open source или open weight?
Разбор 2,8-трлн модели Moonshot AI

Если вы AI-разработчик или tech lead, оценивающий Kimi K3 для интеграции, self-hosting или коммерческого деплоя, публикация полных весов и технического отчёта Moonshot AI 27 июля меняет расчёт для 3T-класса. Kimi K3 — 2,8 трлн общих параметров, контекст 1 млн токенов, три открытых infra-стека: MoonEP, FlashKDA и AgentEnv — через 11 дней после API-only релиза. Статья покрывает хронологию, архитектуру (KDA / AttnRes / Per-Head Muon), infra-релизы, SWE-bench и Artificial Analysis, пороги open-weight лицензии, цены API и шестишаговый playbook интеграции. См. также обзор релиза K3 от 16 июля, скандал дистилляции, рейтинг OpenRouter за июль. Цены: страница тарифов.

Короткий ответ: нет, не в строгом смысле — и Moonshot AI этого не заявляет. Вечером 27 июля 2026 китайская лаборатория опубликовала полные веса и technical report для 2,8-трлн Mixture-of-Experts модели. Скачивание 1,56 ТБ за 30 минут вышло на #1 Hugging Face trending — крупнейшая open-weight модель, когда-либо выпущенная целиком.

  • Терминологическая ловушка: СМИ пишут «open source», но OSI-compliant open source требует публичных training data и воспроизводимого pipeline. K3 публикует веса, technical report и inference infra — не полный training stack.
  • Слепые зоны лицензии: Custom license добавляет два коммерческих порога, отсутствовавших в K2 — $20M MaaS-выручка за 12 месяцев и атрибуция при 100M MAU / $20M месячной выручки.
  • Иллюзия self-hosting: При 2,8T параметров и 896 экспертах K3 недоступен на consumer hardware. Moonshot рекомендует суперузлы 64+ ускорителей; большинство команд идут через API или OpenRouter.
  • Неверное чтение бенчмарков: Независимый SWE-bench Verified: K3 — 93,4%. Сильный результат среди open-weight, но ниже Claude Opus 5 (97%) и GPT-5.6 Sol (96,2%).
  • Cost mismatch: K3 — ~$0,95 за задачу на Intelligence Index: дешевле Claude Fable 5 (~$2,40), дороже GLM-5.2 (~$0,47). Capability ceiling open-weight сегмента, не value pick.
  • Геополитический шум: За дни до весов США обвинили Moonshot в industrial-scale distillation против Fable Anthropic; Минкоммерции КНР 28 июля назвала это «AI-гегемонизмом».

Итог: Kimi K3 — capability ceiling open-weight tier, не учебниковый open-source проект. Большинство стартапов могут деплоить сегодня; если бизнес-модель — перепродажа K3 inference в масштабе против API Moonshot, MaaS revenue gate — юридическая красная линия.

11-дневная хронология от API до полных весов:

  • 16 июля (канун WAIC 2026): K3 на kimi.com, Kimi Work, Kimi Code и Kimi API — только online, веса не опубликованы.
  • 17 июля: Отраслевые architecture deep-dives; госмедиа называют крупнейшей open model по числу параметров.
  • 22–23 июля: Эскалация US-China «model distillation» спора; советник Белого дома Michael Kratsios обвиняет Moonshot в скрытой industrial distillation.
  • 27 июля ~23:00: Полные веса, technical report, MoonEP и AgentEnv (FlashKDA уже был открыт).
  • 28 июля: Публичный ответ Минкоммерции КНР; китайские СМИ освещают детали релиза.

K3 не просто масштабирует существующий рецепт — Moonshot перестроил три долгоживущих default: attention, residual connections и optimizer.

Kimi K3 — сводка
Параметр Значение
Всего параметров2,8 трлн
Активных параметров~104 млрд
АрхитектураMixture-of-Experts (MoE)
Эксперты896 routed, 16 activated per token, плюс shared experts
AttentionKimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA)
Контекст1 000 000 токенов
МультимодальностьNative vision (ViT-V2, 27 слоёв)
Формат весовMXFP4 weights, MXFP8 activations (quantization-aware с SFT)
Размер скачивания~1,56 ТБ (Hugging Face)
ЛицензияCustom — Moonshot: open weight, не open source

Kimi Delta Attention (KDA): Стандартный Gated DeltaNet применяет один scalar forgetting gate ко всему memory state. KDA заменяет channel-wise gating — каждое feature dimension получает свой decay rate. Реализация chunkwise Diagonal-Plus-Low-Rank (DPLR); K3 чередует KDA с небольшим числом full global-attention (Gated MLA) слоёв для 1M токенов при низком KV cache.

Attention Residuals (AttnRes): Стандартные residual connections накапливают каждый слой равномерно — early-layer signal размывается на глубине. AttnRes агрегирует предыдущие слои селективно, input-dependently, ~25% выше training efficiency при <2% дополнительных параметров.

Per-Head Muon: Расширяет Muon optimizer на per-attention-head режим вместо uniform по всей модели — невидимо на API call, но объясняет performance выше active-parameter count.

Stable LatentMoE: 896 экспертов, 16 per token (~1,8% sparsity), плюс shared experts. Quantile Balancing и MoonEP доказывают математическую upper bound redundant experts per rank.

Открытый infra stack
Технология Роль Ключевые цифры
MoonEP MoE communication library в extreme scale Дублирует overloaded experts для равного token count per rank; доказывает upper bound redundant experts
FlashKDA CUTLASS-based KDA kernels (ранее открыты) 1,72x–2,22x faster prefill на NVIDIA H20 vs flash-linear-attention baseline; drop-in через chunk_kda
AgentEnv Firecracker microVM sandbox (с KVCache.ai) Parallel agentic RL; Moonshot: 133ms checkpoint, 49ms resume, до 6,5x memory overcommit (не воспроизведено независимо)
SWE-bench Verified (независимый, Vals AI, июль 2026)
Модель Score Релиз
Claude Opus 597%2026-07-24
GPT-5.6 Sol96,2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393,4%2026-07-16
Qwen3.7-Max79,4%2026-05-19
DeepSeek-V476,2%2026-04-23

Artificial Analysis Intelligence Index (max reasoning): Claude Fable 5 — 60, GPT-5.6 Sol — 59, Kimi K3 ~57 (#3 overall, #1 open-weight), GLM-5.2 — 51, DeepSeek V4 Pro — 44. K3 также #1 на Arena.ai Frontend Code Arena leaderboard.

Custom license содержит два коммерческих порога:

  1. MaaS revenue gate: Model-as-a-Service на K3 с выручкой свыше $20M aggregate за 12 месяцев требует отдельного commercial agreement с Moonshot.
  2. Attribution gate: Продукты с 100M+ MAU или $20M monthly revenue должны prominently отображать «Kimi K3» в UI.
Цены API Kimi K3 (за миллион токенов)
Тип токена Цена
Input (cache hit)$0,30
Input (cache miss)$3,00
Output (incl. reasoning)$15,00

Disaggregated Mooncake serving architecture Moonshot держит cache hit rate >90% на типичных coding workloads — реальная стоимость ближе к $0,30, чем к headline $3,00 input.

  1. Выбрать путь: Self-host (64+ accelerators) vs official API vs OpenRouter. Большинству — API. См. гайд по OpenRouter для multi-provider abstraction.
  2. Прочитать лицензию: Скачать Hugging Face LICENSE и подтвердить, что business model не триггерит MaaS или attribution gates.
  3. Подключить API client: OpenAI SDK client на endpoint Moonshot с model ID kimi-k3 — обычно смена base URL и API key.
  4. Cache-aware billing: Структурировать prompts для Mooncake cache hits на coding workloads, тянуть effective input cost к $0,30/M.
  5. Layered routing: Volume coding на K3 или DeepSeek V4 Flash; сложные шаги — Claude Opus 5 или GPT-5.6 Sol. См. июльский tiering playbook OpenRouter.
  6. 7×24 agent hosts: Long-running agent orchestration требует always-on macOS nodes, не laptops с lid-close sleep. См. центр помощи и страницу заказа.
kimi-k3-api-example.py
# OpenAI SDK-compatible call (verify endpoint and model ID against official docs before shipping)
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention in one paragraph."}]
)
print(response.choices[0].message.content)

  • Parameter count: 2,8T total, ~104B active — крупнейшая open-weight модель, выпущенная целиком (Moonshot technical report).
  • Download size: ~1,56 ТБ; #1 Hugging Face trending за 30 минут после релиза.
  • SWE-bench Verified: 93,4% independent score — сильнейший open-weight результат, ниже Claude Opus 5 97% (Vals AI, июль 2026).
  • Intelligence Index: ~57 max tier, #3 overall и #1 open-weight (Artificial Analysis).
  • FlashKDA speedup: 1,72x–2,22x prefill vs baseline на NVIDIA H20 (Moonshot GitHub).
  • Cache-hit pricing: $0,30/M input cache hit vs $3,00/M miss; 90%+ hit rates на coding workloads (Moonshot).
  • Self-host bar: 64+ accelerator supernodes recommended; семь OpenRouter providers уже хостят K3.

FAQ highlights:

  • Q: Kimi K3 open source? A: Нет по OSI. Open-weight: веса и infra tools публичны; training data и full training code — нет.
  • Q: Коммерческое использование? A: Да в большинстве случаев. MaaS revenue >$20M/12 months или 100M+ MAU триггерят license clauses.
  • Q: Железо для self-hosting? A: 64+ accelerators recommended; API или OpenRouter — практичный путь.
  • Q: Сравнение с GPT-5.6 и Claude? A: Ниже top closed models на SWE-bench, лидер open-weight tier.
  • Q: K3 vs K2? A: ~3x K2.5 parameters, новые AttnRes и Per-Head Muon, расширенный контекст и multimodal, tighter license.

Источники на момент написания; при изменениях upstream сверяйтесь с оригиналом.

https://api.moonshot.ai/v1

https://huggingface.co/moonshotai

https://github.com/moonshotai/FlashKDA

Через три дня после K3 Alibaba — инвестор Moonshot — представила Qwen3.8-Max-Preview на 2,4 трлн параметров, воспринято как прямой ответ. Open-weight гонка вошла в «3T club». Понимание license boundaries и tiered routing важнее спора про метку «open source».

Реальные минусы альтернатив: (1) Скачивание 1,56 ТБ весов плюс local inference на 16GB laptop мгновенно насыщает disk и RAM — routing fallback не снимает hardware ceiling. (2) Lid-close sleep убивает OAuth sessions и long agent batches — «сильнейшая open-weight модель» не тянет 7×24 pipeline на notebook. (3) Покупка maxed Mac Studio для K3 agent workflows с тремя месяцами idle дороже elastic weekly rental — 3T inference на API, не local weights.

Командам, которым нужны dedicated Apple Silicon, 7×24 uptime и elastic day/week/month scaling для Kimi K3 API-driven agents (Hermes, OpenClaw, Kilo Code) вместе с iOS CI на том же macOS host, NOVAKVM Mac Mini bare-metal rental — обычно лучший production path: шесть регионов, high-memory tiers, direct SSH — Moonshot API для inference, bare-metal macOS для orchestration, без dual trap 64-GPU clusters и laptop sleep. Сравните tiers на странице цен NOVAKVM, trial на странице заказа, remote access в центре помощи.