Если вы AI-разработчик, архитектор или ответственный за выбор LLM, в ночь на 16 июля 2026 Moonshot AI тихо повесила в шапку API-документации баннер «Kimi K3 доступен» — без большой презентации, но с 2,8 трлн (2,8T) параметров, крупнейшей open-source моделью на сегодня. В статье: MoE 896 экспертов/16 активных, контекст 1M токенов и нативное зрение, три архитектурных новшества KDA/AttnRes/Stable LatentMoE, полные таблицы против Claude Fable 5 и GPT-5.6 Sol, цены $3/$15 и ¥20/¥100, четыре способа подключения, веса на Hugging Face 27 июля, шесть FAQ. Тарифы узлов: страница цен.
[ SECTION_01 ] // OVERVIEW Что такое Kimi K3: тихий релиз и ключевые характеристики
Kimi K3 — крупнейшая open-source AI-модель по числу параметров: 2,8T, на ~75% больше DeepSeek V4 Pro (1,6T), в 2,7 раза больше open-модели Xiaomi (1,02T) и более чем в 7 раз больше Alibaba (397B). Разреженный MoE активирует 16 из 896 экспертов на проход. 1 048 576 токенов контекста (порядка пяти полных романов за один вызов) плюс нативное понимание изображений и видео — под сложный код, длинные документы и knowledge work.
Кратко: open-source «тяжёлый coding AI» с мультимодальностью и сверхдлинной памятью, на ~40% дешевле Claude Opus 4.8 по output, полные веса 27 июля.
Три жёстких ограничения до продакшена:
- Self-hosting: для prod нужен суперузел 64+ ускорителей — открытые веса не означают «запустится на ноутбуке».
- Бенчмарки: Moonshot использовал Kimi Code, Codex, Claude Code — независимое воспроизведение ещё идёт.
- Не лидер везде: FrontierSWE и Terminal Bench 2.1 ведут Claude Fable 5 или GPT-5.6 Sol — выбор по матрице задач, не по «максимум параметров».
| Параметр | Kimi K3 |
|---|---|
| Всего параметров | 2,8 трлн (2,8T) |
| Архитектура | KDA + AttnRes + Stable LatentMoE |
| Разреженность MoE | 896 экспертов, 16 активных (1,8%) |
| Окно контекста | 1 048 576 токенов (1M) |
| Входные модальности | Текст, изображение, видео |
| ID модели API | kimi-k3 |
| Open weights | 27 июля 2026 на Hugging Face |
Тихий релиз контрастирует с масштабом 2,8T — не PR-параметры, а заявление технического суверенитета в фазе коммерциализации.
[ SECTION_02 ] // ARCHITECTURE После удара DeepSeek: бизнес-контекст и три инновации
За 18 месяцев Moonshot сильно потеряла долю из-за DeepSeek. K3 — контратака, приуроченная к World AI Conference (WAIC) 2026 в Шанхае.
- 9 из 12 месяцев Kimi держала рекорд open-source по размеру;
- ARR (июнь 2026) выше $300 млн;
- 6-й раунд финансирования в этом году, pre-money $31,5 млрд;
- Доля API в выручке более 70%, зарубежные платные пользователи +400%.
Kimi Delta Attention (KDA) — пересборка attention
Полный attention масштабируется квадратично; при 1M токенов KV-cache становится неподъёмным. KDA чередует линейный и полный attention в ratio 3:1:
- Три линейных слоя для локальной структуры, один полный — для глобального потока;
- KV-cache меньше до 75%;
- Декодирование до 6,3× быстрее на 1M токенов;
- Обходит full-attention baseline в коротком, длинном контексте и RL.
Attention Residuals (AttnRes) — потеря сигнала по глубине
- Классические residual равномерно накапливают представления — ранние слои размываются;
- AttnRes даёт селективное извлечение ценных ранних фич;
- Около 25% прироста эффективности обучения, доп. compute <2%.
Stable LatentMoE — стабильное обучение при экстремальной sparsity
896 экспертов, 16 активных (1,8%). Quantile Balancing, Per-Head Muon, SiTU, Gated MLA. Vs Kimi K2: ~2,5× лучшая scaling efficiency.
| Техника | Роль |
|---|---|
| Quantile Balancing | Распределение экспертов из квантилей router score, без хрупких эвристик |
| Per-Head Muon | Независимая оптимизация каждой attention-головы |
| SiTU | Улучшенный контроль activation |
| Gated MLA | Выше селективность attention |
[ SECTION_03 ] // BENCHMARKS Таблицы бенчмарков и сравнение цен
Ключевые бенчмарки Moonshot (с GLM-5.2), 16.07.2026:
| Бенчмарк | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 12.9 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 91.2 |
| MMMU-Pro (vision) | 81.6 | 81.2 | 83.0 | 78.9 | — |
| OmniDocBench (документы) | 91.1 | 89.8 | 85.8 | 87.9 | — |
SWE Marathon: K3 лидирует с 42,0; Program Bench 77,8; FrontierSWE — Fable 5 с 86,6; OmniDocBench 91,1 показывает синергию vision + длинного контекста. Artificial Analysis Intelligence Index v4.1: K3 57,1 (4-е место), после Fable 5 (59,9) и GPT-5.6 Sol (58,9) — отрыв от лидера 2,8 пункта.
Важно: self-reported, разные harness. Используйте как ориентир, не как единственный критерий закупки.
| Модель | Input | Output | Cache-hit input | Контекст |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00 (promo $2) | $15.00 (promo $10) | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
K3 стоит как Sonnet 5 ($3/$15), но даёт 5× контекст. Cache hit от $0,30/M; Moonshot сообщает >90% hit rate в coding. Китай: ¥20/M input, ¥100/M output, cache ¥2/M. Бесплатно на kimi.com, prepaid от ¥199 (до 11 августа).
[ SECTION_04 ] // ACCESS Четыре способа доступа, шесть шагов, матрица сценариев
Четыре немедленных пути:
- Web/App Kimi: kimi.com, Google-аккаунт, max reasoning, без карты.
- Официальный API: ключ на platform.kimi.ai, модель
kimi-k3, OpenAI-compatible. - OpenRouter:
moonshotai/kimi-k3, официальные цены, полный 1M. - С 27 июля: веса Hugging Face — prod требует 64+ GPU.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Проанализируй этот код..."}]
)
- Границы задачи: по матрице бенчмарков — SWE Marathon, repo-bugfix, terminal agent, multimodal docs.
- Тест kimi.com: типовые промпты, vision и длинный контекст.
- API Key: platform.kimi.ai, лимиты, ¥20/¥100/¥2.
- SDK:
base_url=https://api.moonshot.ai/v1, модельkimi-k3; или OpenRouter. - Кэш: стабильные префиксы под Mooncake — эффективный input ~$0,55/M.
- Фиксация execution surface: Xcode, Fastlane, multi-model routing на 7×24 Apple Silicon bare metal — API и iOS CI/CD на одной машине; не привязывайте релиз iOS к 64+ GPU до 27 июля. См. NOVAKVM ниже.
| Сценарий | Модель | Почему |
|---|---|---|
| Длинные coding-сессии (SWE Marathon) | Kimi K3 | Лидер бенчмарка, макс. контекст |
| Сложные баги в большом repo | Claude Fable 5 | FrontierSWE впереди |
| Terminal/tool agents | GPT-5.6 Sol | Terminal Bench 2.1 |
| Длинные документы / multimodal | Kimi K3 | OmniDocBench #1, vision + 1M |
| Жёсткий бюджет | DeepSeek V4 Pro | Output $3,48/M |
| Open self-host (после 27.7.) | Kimi K3 | Сильнейшие open weights, 2,8T |
[ SECTION_05 ] // OPEN_SOURCE Open-source 27 июля: что дают веса
Moonshot обещает полные веса 27 июля 2026. Крупнейшая скачиваемая open-модель, первая open-weight >2T, новая база для fine-tune. MXFP4/NVFP4 на Hugging Face; vLLM, SGLang — day-0.
2,8T ≠ ноутбук. Prod: суперузел 64+ accelerators (NVIDIA H100).
| Дата | Событие |
|---|---|
| 16 июля 2026 | API live, баннер docs и pricing |
| 17–20 июля 2026 | WAIC Shanghai |
| 27 июля 2026 | Полные веса на Hugging Face |
| 11 августа 2026 | Конец акции prepaid ¥199 |
Вехи: WAIC 17–20 июля → веса 27 июля.
[ SECTION_06 ] // DATA Цитируемые данные, FAQ, вывод
- Параметры: 2,8T, MoE 896/16, sparsity 1,8%.
- KDA: 3:1 linear/full, KV −75%, decode ×6,3 на 1M.
- AttnRes: ~+25% training efficiency, compute <2%.
- Scaling: ~×2,5 vs Kimi K2.
- Intelligence Index v4.1: 57,1, 4-е место.
- API: $3/$15, cache $0,30; Китай ¥20/¥100/¥2.
FAQ:
- Бесплатно? Да на kimi.com; API платный $3/$15 за 1M tokens.
- Локально? До 27.7. нет; потом 64+ GPU для prod. Mac Mini не потянет 2,8T inference.
- Vs DeepSeek V4 Pro? 2,8T vs 1,6T, 1M vs 128K, сильнее бенчмарки — но output DeepSeek $3,48/M.
- 1M tokens полезен? Да для whole-repo, длинных PDF/юрдоков, long-memory agents — flat pricing.
- Бенчмарки надёжны? Self-reported — A/B на своих задачах.
- Режимы low/high? Анонсированы; сейчас только
max.
Kimi K3 — не параметрический фасад: KDA, AttnRes, Stable LatentMoE — реальная инженерия. Не победа во всех бенчмарках — Fable 5 и GPT-5.6 Sol лидируют точечно — но связка 1M контекста и цены уровня Sonnet уникальна для длинного coding и понимания документов.
Источники — перепроверьте после обновлений:
Официальный блог Moonshot: Kimi K3
OpenRouter: moonshotai/kimi-k3
Artificial Analysis Intelligence Index
SCMP: Moonshot AI releases Kimi K3
Если iOS-тесты, multi-model agent routing и API-валидацию полностью завязать на локальный 2,8T-кластер или ещё закрытые веса Hugging Face, стоимость 64+ GPU и пауза до 27 июля сорвут инженерный ритм; один API-тrial не заменит стабильный 7×24 Xcode CI на Apple Silicon с нативной цепочкой сборки Metal.
Чтобы в окне подключения Kimi K3 зафиксировать Apple Silicon execution layer, стабилизировать iOS CI/CD и prod-валидацию AI-агентов — перенести Xcode, Fastlane и multi-model automation на выделенный bare-metal Mac Mini для вызовов K3 API, а не локального inference 2,8T — NOVAKVM обычно предсказуемее собственного GPU-суперузла: multi-region Mac Mini M4 / M4 Pro, гибкий срок, фиксированная полоса, SSH по умолчанию. Цены, Заказ, Центр помощи.