Kimi K3: 2,8 трлн параметров,
новый рекорд open-source LLM

Если вы AI-разработчик, архитектор или ответственный за выбор LLM, в ночь на 16 июля 2026 Moonshot AI тихо повесила в шапку API-документации баннер «Kimi K3 доступен» — без большой презентации, но с 2,8 трлн (2,8T) параметров, крупнейшей open-source моделью на сегодня. В статье: MoE 896 экспертов/16 активных, контекст 1M токенов и нативное зрение, три архитектурных новшества KDA/AttnRes/Stable LatentMoE, полные таблицы против Claude Fable 5 и GPT-5.6 Sol, цены $3/$15 и ¥20/¥100, четыре способа подключения, веса на Hugging Face 27 июля, шесть FAQ. Тарифы узлов: страница цен.

Kimi K3 — крупнейшая open-source AI-модель по числу параметров: 2,8T, на ~75% больше DeepSeek V4 Pro (1,6T), в 2,7 раза больше open-модели Xiaomi (1,02T) и более чем в 7 раз больше Alibaba (397B). Разреженный MoE активирует 16 из 896 экспертов на проход. 1 048 576 токенов контекста (порядка пяти полных романов за один вызов) плюс нативное понимание изображений и видео — под сложный код, длинные документы и knowledge work.

Кратко: open-source «тяжёлый coding AI» с мультимодальностью и сверхдлинной памятью, на ~40% дешевле Claude Opus 4.8 по output, полные веса 27 июля.

Три жёстких ограничения до продакшена:

  • Self-hosting: для prod нужен суперузел 64+ ускорителей — открытые веса не означают «запустится на ноутбуке».
  • Бенчмарки: Moonshot использовал Kimi Code, Codex, Claude Code — независимое воспроизведение ещё идёт.
  • Не лидер везде: FrontierSWE и Terminal Bench 2.1 ведут Claude Fable 5 или GPT-5.6 Sol — выбор по матрице задач, не по «максимум параметров».
Ключевые характеристики Kimi K3
Параметр Kimi K3
Всего параметров 2,8 трлн (2,8T)
Архитектура KDA + AttnRes + Stable LatentMoE
Разреженность MoE 896 экспертов, 16 активных (1,8%)
Окно контекста 1 048 576 токенов (1M)
Входные модальности Текст, изображение, видео
ID модели API kimi-k3
Open weights 27 июля 2026 на Hugging Face

Тихий релиз контрастирует с масштабом 2,8T — не PR-параметры, а заявление технического суверенитета в фазе коммерциализации.

За 18 месяцев Moonshot сильно потеряла долю из-за DeepSeek. K3 — контратака, приуроченная к World AI Conference (WAIC) 2026 в Шанхае.

  • 9 из 12 месяцев Kimi держала рекорд open-source по размеру;
  • ARR (июнь 2026) выше $300 млн;
  • 6-й раунд финансирования в этом году, pre-money $31,5 млрд;
  • Доля API в выручке более 70%, зарубежные платные пользователи +400%.

Kimi Delta Attention (KDA) — пересборка attention

Полный attention масштабируется квадратично; при 1M токенов KV-cache становится неподъёмным. KDA чередует линейный и полный attention в ratio 3:1:

  • Три линейных слоя для локальной структуры, один полный — для глобального потока;
  • KV-cache меньше до 75%;
  • Декодирование до 6,3× быстрее на 1M токенов;
  • Обходит full-attention baseline в коротком, длинном контексте и RL.

Attention Residuals (AttnRes) — потеря сигнала по глубине

  • Классические residual равномерно накапливают представления — ранние слои размываются;
  • AttnRes даёт селективное извлечение ценных ранних фич;
  • Около 25% прироста эффективности обучения, доп. compute <2%.

Stable LatentMoE — стабильное обучение при экстремальной sparsity

896 экспертов, 16 активных (1,8%). Quantile Balancing, Per-Head Muon, SiTU, Gated MLA. Vs Kimi K2: ~2,5× лучшая scaling efficiency.

Техники Stable LatentMoE
Техника Роль
Quantile Balancing Распределение экспертов из квантилей router score, без хрупких эвристик
Per-Head Muon Независимая оптимизация каждой attention-головы
SiTU Улучшенный контроль activation
Gated MLA Выше селективность attention

Ключевые бенчмарки Moonshot (с GLM-5.2), 16.07.2026:

Kimi K3 vs flagship (Moonshot self-reported, 2026-07-16)
Бенчмарк Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GLM-5.2
DeepSWE 67.5 70.0 73.0 59.0 46.2
Program Bench 77.8 76.8 77.6 71.9 63.7
Terminal Bench 2.1 88.3 84.6 88.8 84.6 82.7
FrontierSWE 81.2 86.6 71.3 66.7 67.3
SWE Marathon 42.0 35.0 39.0 40.0 13.0
BrowseComp 91.2 88.0 90.4 84.3
Automation Bench 30.8 29.1 29.7 27.2 12.9
GPQA-Diamond 93.5 92.6 94.1 91.0 91.2
MMMU-Pro (vision) 81.6 81.2 83.0 78.9
OmniDocBench (документы) 91.1 89.8 85.8 87.9

SWE Marathon: K3 лидирует с 42,0; Program Bench 77,8; FrontierSWE — Fable 5 с 86,6; OmniDocBench 91,1 показывает синергию vision + длинного контекста. Artificial Analysis Intelligence Index v4.1: K3 57,1 (4-е место), после Fable 5 (59,9) и GPT-5.6 Sol (58,9) — отрыв от лидера 2,8 пункта.

Важно: self-reported, разные harness. Используйте как ориентир, не как единственный критерий закупки.

Цены API ($/M tokens, 2026-07-16)
Модель Input Output Cache-hit input Контекст
Kimi K3 $3.00 $15.00 $0.30 1M
Claude Sonnet 5 $3.00 (promo $2) $15.00 (promo $10) 200K
Claude Opus 4.8 $5.00 $25.00 200K
GPT-5.5 $5.00 $30.00 400K
DeepSeek V4 Pro $1.74 $3.48 $0.145 128K
Kimi K2.6 $0.95 $4.00 $0.16 256K

K3 стоит как Sonnet 5 ($3/$15), но даёт 5× контекст. Cache hit от $0,30/M; Moonshot сообщает >90% hit rate в coding. Китай: ¥20/M input, ¥100/M output, cache ¥2/M. Бесплатно на kimi.com, prepaid от ¥199 (до 11 августа).

Четыре немедленных пути:

  • Web/App Kimi: kimi.com, Google-аккаунт, max reasoning, без карты.
  • Официальный API: ключ на platform.kimi.ai, модель kimi-k3, OpenAI-compatible.
  • OpenRouter: moonshotai/kimi-k3, официальные цены, полный 1M.
  • С 27 июля: веса Hugging Face — prod требует 64+ GPU.
kimi_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Проанализируй этот код..."}]
)
  1. Границы задачи: по матрице бенчмарков — SWE Marathon, repo-bugfix, terminal agent, multimodal docs.
  2. Тест kimi.com: типовые промпты, vision и длинный контекст.
  3. API Key: platform.kimi.ai, лимиты, ¥20/¥100/¥2.
  4. SDK: base_url=https://api.moonshot.ai/v1, модель kimi-k3; или OpenRouter.
  5. Кэш: стабильные префиксы под Mooncake — эффективный input ~$0,55/M.
  6. Фиксация execution surface: Xcode, Fastlane, multi-model routing на 7×24 Apple Silicon bare metal — API и iOS CI/CD на одной машине; не привязывайте релиз iOS к 64+ GPU до 27 июля. См. NOVAKVM ниже.
Матрица выбора Kimi K3
Сценарий Модель Почему
Длинные coding-сессии (SWE Marathon) Kimi K3 Лидер бенчмарка, макс. контекст
Сложные баги в большом repo Claude Fable 5 FrontierSWE впереди
Terminal/tool agents GPT-5.6 Sol Terminal Bench 2.1
Длинные документы / multimodal Kimi K3 OmniDocBench #1, vision + 1M
Жёсткий бюджет DeepSeek V4 Pro Output $3,48/M
Open self-host (после 27.7.) Kimi K3 Сильнейшие open weights, 2,8T

Moonshot обещает полные веса 27 июля 2026. Крупнейшая скачиваемая open-модель, первая open-weight >2T, новая база для fine-tune. MXFP4/NVFP4 на Hugging Face; vLLM, SGLang — day-0.

2,8T ≠ ноутбук. Prod: суперузел 64+ accelerators (NVIDIA H100).

Вехи Kimi K3
Дата Событие
16 июля 2026 API live, баннер docs и pricing
17–20 июля 2026 WAIC Shanghai
27 июля 2026 Полные веса на Hugging Face
11 августа 2026 Конец акции prepaid ¥199

Вехи: WAIC 17–20 июлявеса 27 июля.

  • Параметры: 2,8T, MoE 896/16, sparsity 1,8%.
  • KDA: 3:1 linear/full, KV −75%, decode ×6,3 на 1M.
  • AttnRes: ~+25% training efficiency, compute <2%.
  • Scaling: ~×2,5 vs Kimi K2.
  • Intelligence Index v4.1: 57,1, 4-е место.
  • API: $3/$15, cache $0,30; Китай ¥20/¥100/¥2.

FAQ:

  • Бесплатно? Да на kimi.com; API платный $3/$15 за 1M tokens.
  • Локально? До 27.7. нет; потом 64+ GPU для prod. Mac Mini не потянет 2,8T inference.
  • Vs DeepSeek V4 Pro? 2,8T vs 1,6T, 1M vs 128K, сильнее бенчмарки — но output DeepSeek $3,48/M.
  • 1M tokens полезен? Да для whole-repo, длинных PDF/юрдоков, long-memory agents — flat pricing.
  • Бенчмарки надёжны? Self-reported — A/B на своих задачах.
  • Режимы low/high? Анонсированы; сейчас только max.

Kimi K3 — не параметрический фасад: KDA, AttnRes, Stable LatentMoE — реальная инженерия. Не победа во всех бенчмарках — Fable 5 и GPT-5.6 Sol лидируют точечно — но связка 1M контекста и цены уровня Sonnet уникальна для длинного coding и понимания документов.

Источники — перепроверьте после обновлений:

Официальный блог Moonshot: Kimi K3

Kimi API Platform

OpenRouter: moonshotai/kimi-k3

Artificial Analysis Intelligence Index

SCMP: Moonshot AI releases Kimi K3

VentureBeat: Kimi K3 coverage

Если iOS-тесты, multi-model agent routing и API-валидацию полностью завязать на локальный 2,8T-кластер или ещё закрытые веса Hugging Face, стоимость 64+ GPU и пауза до 27 июля сорвут инженерный ритм; один API-тrial не заменит стабильный 7×24 Xcode CI на Apple Silicon с нативной цепочкой сборки Metal.

Чтобы в окне подключения Kimi K3 зафиксировать Apple Silicon execution layer, стабилизировать iOS CI/CD и prod-валидацию AI-агентов — перенести Xcode, Fastlane и multi-model automation на выделенный bare-metal Mac Mini для вызовов K3 API, а не локального inference 2,8T — NOVAKVM обычно предсказуемее собственного GPU-суперузла: multi-region Mac Mini M4 / M4 Pro, гибкий срок, фиксированная полоса, SSH по умолчанию. Цены, Заказ, Центр помощи.