Если вы AI-разработчик или tech lead, оценивающий Kimi K3 для интеграции, self-hosting или коммерческого деплоя, публикация полных весов и технического отчёта Moonshot AI 27 июля меняет расчёт для 3T-класса. Kimi K3 — 2,8 трлн общих параметров, контекст 1 млн токенов, три открытых infra-стека: MoonEP, FlashKDA и AgentEnv — через 11 дней после API-only релиза. Статья покрывает хронологию, архитектуру (KDA / AttnRes / Per-Head Muon), infra-релизы, SWE-bench и Artificial Analysis, пороги open-weight лицензии, цены API и шестишаговый playbook интеграции. См. также обзор релиза K3 от 16 июля, скандал дистилляции, рейтинг OpenRouter за июль. Цены: страница тарифов.
[ SECTION_01 ] // PAIN_POINTS Зачем пересматривать model stack после open-weight релиза Kimi K3?
Короткий ответ: нет, не в строгом смысле — и Moonshot AI этого не заявляет. Вечером 27 июля 2026 китайская лаборатория опубликовала полные веса и technical report для 2,8-трлн Mixture-of-Experts модели. Скачивание 1,56 ТБ за 30 минут вышло на #1 Hugging Face trending — крупнейшая open-weight модель, когда-либо выпущенная целиком.
- Терминологическая ловушка: СМИ пишут «open source», но OSI-compliant open source требует публичных training data и воспроизводимого pipeline. K3 публикует веса, technical report и inference infra — не полный training stack.
- Слепые зоны лицензии: Custom license добавляет два коммерческих порога, отсутствовавших в K2 — $20M MaaS-выручка за 12 месяцев и атрибуция при 100M MAU / $20M месячной выручки.
- Иллюзия self-hosting: При 2,8T параметров и 896 экспертах K3 недоступен на consumer hardware. Moonshot рекомендует суперузлы 64+ ускорителей; большинство команд идут через API или OpenRouter.
- Неверное чтение бенчмарков: Независимый SWE-bench Verified: K3 — 93,4%. Сильный результат среди open-weight, но ниже Claude Opus 5 (97%) и GPT-5.6 Sol (96,2%).
- Cost mismatch: K3 — ~$0,95 за задачу на Intelligence Index: дешевле Claude Fable 5 (~$2,40), дороже GLM-5.2 (~$0,47). Capability ceiling open-weight сегмента, не value pick.
- Геополитический шум: За дни до весов США обвинили Moonshot в industrial-scale distillation против Fable Anthropic; Минкоммерции КНР 28 июля назвала это «AI-гегемонизмом».
Итог: Kimi K3 — capability ceiling open-weight tier, не учебниковый open-source проект. Большинство стартапов могут деплоить сегодня; если бизнес-модель — перепродажа K3 inference в масштабе против API Moonshot, MaaS revenue gate — юридическая красная линия.
11-дневная хронология от API до полных весов:
- 16 июля (канун WAIC 2026): K3 на kimi.com, Kimi Work, Kimi Code и Kimi API — только online, веса не опубликованы.
- 17 июля: Отраслевые architecture deep-dives; госмедиа называют крупнейшей open model по числу параметров.
- 22–23 июля: Эскалация US-China «model distillation» спора; советник Белого дома Michael Kratsios обвиняет Moonshot в скрытой industrial distillation.
- 27 июля ~23:00: Полные веса, technical report, MoonEP и AgentEnv (FlashKDA уже был открыт).
- 28 июля: Публичный ответ Минкоммерции КНР; китайские СМИ освещают детали релиза.
[ SECTION_02 ] // ARCHITECTURE Спеки Kimi K3 и три архитектурных решения
K3 не просто масштабирует существующий рецепт — Moonshot перестроил три долгоживущих default: attention, residual connections и optimizer.
| Параметр | Значение |
|---|---|
| Всего параметров | 2,8 трлн |
| Активных параметров | ~104 млрд |
| Архитектура | Mixture-of-Experts (MoE) |
| Эксперты | 896 routed, 16 activated per token, плюс shared experts |
| Attention | Kimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA) |
| Контекст | 1 000 000 токенов |
| Мультимодальность | Native vision (ViT-V2, 27 слоёв) |
| Формат весов | MXFP4 weights, MXFP8 activations (quantization-aware с SFT) |
| Размер скачивания | ~1,56 ТБ (Hugging Face) |
| Лицензия | Custom — Moonshot: open weight, не open source |
Kimi Delta Attention (KDA): Стандартный Gated DeltaNet применяет один scalar forgetting gate ко всему memory state. KDA заменяет channel-wise gating — каждое feature dimension получает свой decay rate. Реализация chunkwise Diagonal-Plus-Low-Rank (DPLR); K3 чередует KDA с небольшим числом full global-attention (Gated MLA) слоёв для 1M токенов при низком KV cache.
Attention Residuals (AttnRes): Стандартные residual connections накапливают каждый слой равномерно — early-layer signal размывается на глубине. AttnRes агрегирует предыдущие слои селективно, input-dependently, ~25% выше training efficiency при <2% дополнительных параметров.
Per-Head Muon: Расширяет Muon optimizer на per-attention-head режим вместо uniform по всей модели — невидимо на API call, но объясняет performance выше active-parameter count.
Stable LatentMoE: 896 экспертов, 16 per token (~1,8% sparsity), плюс shared experts. Quantile Balancing и MoonEP доказывают математическую upper bound redundant experts per rank.
[ SECTION_03 ] // INFRA_BENCH Три infra-релиза и позиция K3 на бенчмарках
| Технология | Роль | Ключевые цифры |
|---|---|---|
| MoonEP | MoE communication library в extreme scale | Дублирует overloaded experts для равного token count per rank; доказывает upper bound redundant experts |
| FlashKDA | CUTLASS-based KDA kernels (ранее открыты) | 1,72x–2,22x faster prefill на NVIDIA H20 vs flash-linear-attention baseline; drop-in через chunk_kda |
| AgentEnv | Firecracker microVM sandbox (с KVCache.ai) | Parallel agentic RL; Moonshot: 133ms checkpoint, 49ms resume, до 6,5x memory overcommit (не воспроизведено независимо) |
| Модель | Score | Релиз |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96,2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93,4% | 2026-07-16 |
| Qwen3.7-Max | 79,4% | 2026-05-19 |
| DeepSeek-V4 | 76,2% | 2026-04-23 |
Artificial Analysis Intelligence Index (max reasoning): Claude Fable 5 — 60, GPT-5.6 Sol — 59, Kimi K3 ~57 (#3 overall, #1 open-weight), GLM-5.2 — 51, DeepSeek V4 Pro — 44. K3 также #1 на Arena.ai Frontend Code Arena leaderboard.
[ SECTION_04 ] // LICENSE_DEPLOY Пороги open-weight лицензии и шестишаговый playbook интеграции
Custom license содержит два коммерческих порога:
- MaaS revenue gate: Model-as-a-Service на K3 с выручкой свыше $20M aggregate за 12 месяцев требует отдельного commercial agreement с Moonshot.
- Attribution gate: Продукты с 100M+ MAU или $20M monthly revenue должны prominently отображать «Kimi K3» в UI.
| Тип токена | Цена |
|---|---|
| Input (cache hit) | $0,30 |
| Input (cache miss) | $3,00 |
| Output (incl. reasoning) | $15,00 |
Disaggregated Mooncake serving architecture Moonshot держит cache hit rate >90% на типичных coding workloads — реальная стоимость ближе к $0,30, чем к headline $3,00 input.
- Выбрать путь: Self-host (64+ accelerators) vs official API vs OpenRouter. Большинству — API. См. гайд по OpenRouter для multi-provider abstraction.
- Прочитать лицензию: Скачать Hugging Face LICENSE и подтвердить, что business model не триггерит MaaS или attribution gates.
- Подключить API client: OpenAI SDK client на endpoint Moonshot с model ID
kimi-k3— обычно смена base URL и API key. - Cache-aware billing: Структурировать prompts для Mooncake cache hits на coding workloads, тянуть effective input cost к $0,30/M.
- Layered routing: Volume coding на K3 или DeepSeek V4 Flash; сложные шаги — Claude Opus 5 или GPT-5.6 Sol. См. июльский tiering playbook OpenRouter.
- 7×24 agent hosts: Long-running agent orchestration требует always-on macOS nodes, не laptops с lid-close sleep. См. центр помощи и страницу заказа.
# OpenAI SDK-compatible call (verify endpoint and model ID against official docs before shipping)
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain Kimi Delta Attention in one paragraph."}]
)
print(response.choices[0].message.content)
[ SECTION_05 ] // FACTS_FAQ Цитируемые hard data, FAQ и заключение про 7×24 hosting
- Parameter count: 2,8T total, ~104B active — крупнейшая open-weight модель, выпущенная целиком (Moonshot technical report).
- Download size: ~1,56 ТБ; #1 Hugging Face trending за 30 минут после релиза.
- SWE-bench Verified: 93,4% independent score — сильнейший open-weight результат, ниже Claude Opus 5 97% (Vals AI, июль 2026).
- Intelligence Index: ~57 max tier, #3 overall и #1 open-weight (Artificial Analysis).
- FlashKDA speedup: 1,72x–2,22x prefill vs baseline на NVIDIA H20 (Moonshot GitHub).
- Cache-hit pricing: $0,30/M input cache hit vs $3,00/M miss; 90%+ hit rates на coding workloads (Moonshot).
- Self-host bar: 64+ accelerator supernodes recommended; семь OpenRouter providers уже хостят K3.
FAQ highlights:
- Q: Kimi K3 open source? A: Нет по OSI. Open-weight: веса и infra tools публичны; training data и full training code — нет.
- Q: Коммерческое использование? A: Да в большинстве случаев. MaaS revenue >$20M/12 months или 100M+ MAU триггерят license clauses.
- Q: Железо для self-hosting? A: 64+ accelerators recommended; API или OpenRouter — практичный путь.
- Q: Сравнение с GPT-5.6 и Claude? A: Ниже top closed models на SWE-bench, лидер open-weight tier.
- Q: K3 vs K2? A: ~3x K2.5 parameters, новые AttnRes и Per-Head Muon, расширенный контекст и multimodal, tighter license.
Источники на момент написания; при изменениях upstream сверяйтесь с оригиналом.
https://huggingface.co/moonshotai
https://github.com/moonshotai/FlashKDA
Через три дня после K3 Alibaba — инвестор Moonshot — представила Qwen3.8-Max-Preview на 2,4 трлн параметров, воспринято как прямой ответ. Open-weight гонка вошла в «3T club». Понимание license boundaries и tiered routing важнее спора про метку «open source».
Реальные минусы альтернатив: (1) Скачивание 1,56 ТБ весов плюс local inference на 16GB laptop мгновенно насыщает disk и RAM — routing fallback не снимает hardware ceiling. (2) Lid-close sleep убивает OAuth sessions и long agent batches — «сильнейшая open-weight модель» не тянет 7×24 pipeline на notebook. (3) Покупка maxed Mac Studio для K3 agent workflows с тремя месяцами idle дороже elastic weekly rental — 3T inference на API, не local weights.
Командам, которым нужны dedicated Apple Silicon, 7×24 uptime и elastic day/week/month scaling для Kimi K3 API-driven agents (Hermes, OpenClaw, Kilo Code) вместе с iOS CI на том же macOS host, NOVAKVM Mac Mini bare-metal rental — обычно лучший production path: шесть регионов, high-memory tiers, direct SSH — Moonshot API для inference, bare-metal macOS для orchestration, без dual trap 64-GPU clusters и laptop sleep. Сравните tiers на странице цен NOVAKVM, trial на странице заказа, remote access в центре помощи.