Kimi K3 : 2,8 billions de paramètres,
nouveau record open source

Si vous êtes développeur IA, responsable d'architecture ou décideur technique, la nuit du 16 juillet 2026 Moonshot AI a affiché discrètement en tête de sa documentation API : Kimi K3 est en ligne. Pas de keynote — mais 2,8 billions (2,8T) de paramètres, le plus grand modèle open source jamais publié. Cet article couvre MoE 896 experts/16 actifs, contexte 1M tokens et vision native, les innovations KDA/AttnRes/Stable LatentMoE, tableaux complets face à Claude Fable 5 et GPT-5.6 Sol, tarifs $3/$15 et ¥20/¥100, quatre voies d'accès immédiat, poids Hugging Face le 27 juillet, et six FAQ. Tarifs nœuds : page tarifs.

Kimi K3 est le plus grand modèle IA open source par nombre de paramètres : 2,8T, soit ~75 % de plus que DeepSeek V4 Pro (1,6T), 2,7× le modèle open de Xiaomi (1,02T) et plus de 7× Alibaba (397B). Architecture MoE sparse : 16 experts activés sur 896 à chaque passe. Contexte 1 048 576 tokens (l'équivalent de cinq romans intégraux) et compréhension native image/vidéo pour le code complexe, le raisonnement long et le travail documentaire.

En une phrase : un IA de code open source multimodale à mémoire très longue, ~40 % moins chère en sortie que Claude Opus 4.8, poids complets le 27 juillet.

Trois freins avant déploiement :

  • Auto-hébergement : la production exige un supernœud 64+ accélérateurs — les poids ouverts ne signifient pas exécution sur MacBook.
  • Benchmarks auto-déclarés : harness Kimi Code, Codex, Claude Code — reproductions tierces en cours.
  • Pas leader partout : FrontierSWE et Terminal Bench 2.1 restent devant chez Fable 5 ou GPT-5.6 Sol — choisir par matrice de tâches.
Spécifications clés Kimi K3
Dimension Kimi K3
Paramètres totaux 2,8 billions (2,8T)
Architecture KDA + AttnRes + Stable LatentMoE
Sparsité MoE 896 experts, 16 actifs (1,8 %)
Fenêtre de contexte 1 048 576 tokens (1M)
Modalités entrée Texte, image, vidéo
ID modèle API kimi-k3
Poids open source 27 juillet 2026 sur Hugging Face

Lancement silencieux et échelle 2,8T : moins un concours de chiffres qu une affirmation technique en phase de commercialisation accélérée.

Moonshot a perdu une part significative du marché face à DeepSeek en 18 mois. K3 est la contre-attaque, calée la veille de la World AI Conference (WAIC) 2026 à Shanghai.

  • 9 mois sur 12, Kimi détenait le record open source par taille ;
  • ARR (juin 2026) au-delà de 300 M$ ;
  • 6e tour de financement cette année, valorisation pre-money 31,5 Md$ ;
  • Revenus API >70 % du total, utilisateurs payants à l'étranger +400 %.

Kimi Delta Attention (KDA) — repenser l attention

L attention complète explose quadratiquement ; à 1M tokens le cache KV devient ingérable. KDA alterne attention linéaire et complète en ratio 3:1 :

  • Trois couches linéaires pour le local, une complète pour le flux global ;
  • Cache KV réduit jusqu à 75 % ;
  • Décodage jusqu à 6,3× plus rapide à 1M tokens ;
  • Surpasse les baselines full-attention en contexte court, long et en RL.

Attention Residuals (AttnRes) — perte d information en profondeur

  • Les résidus classiques diluent les représentations des premières couches ;
  • AttnRes permet une récupération sélective des features précoces ;
  • ~25 % d'efficacité d'entraînement en plus, coût compute <2 %.

Stable LatentMoE — sparsité extrême stabilisée

896 experts, 16 actifs (1,8 %). Quantile Balancing, Per-Head Muon, SiTU, Gated MLA. Vs Kimi K2 : ~2,5× meilleure efficacité de scaling.

Techniques Stable LatentMoE
Technique Rôle
Quantile Balancing Allocation d experts depuis les quantiles du routeur, sans hyperparamètres fragiles
Per-Head Muon Optimisation par tête d attention — apprentissage adaptatif à grande échelle
SiTU Meilleur contrôle des activations
Gated MLA Sélectivité attention renforcée

Benchmarks clés Moonshot (avec GLM-5.2), au 16.07.2026 :

Kimi K3 vs modèles flagship (Moonshot, 2026-07-16)
Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GLM-5.2
DeepSWE 67.5 70.0 73.0 59.0 46.2
Program Bench 77.8 76.8 77.6 71.9 63.7
Terminal Bench 2.1 88.3 84.6 88.8 84.6 82.7
FrontierSWE 81.2 86.6 71.3 66.7 67.3
SWE Marathon 42.0 35.0 39.0 40.0 13.0
BrowseComp 91.2 88.0 90.4 84.3
Automation Bench 30.8 29.1 29.7 27.2 12.9
GPQA-Diamond 93.5 92.6 94.1 91.0 91.2
MMMU-Pro (vision) 81.6 81.2 83.0 78.9
OmniDocBench (documents) 91.1 89.8 85.8 87.9

SWE Marathon : K3 mène à 42,0 ; Program Bench 77,8 ; FrontierSWE : Fable 5 à 86,6 ; OmniDocBench 91,1 illustre vision + long contexte. Artificial Analysis Intelligence Index v4.1 : K3 57,1 (4e rang), derrière Fable 5 (59,9) et GPT-5.6 Sol (58,9) — écart au leader 2,8 points.

Attention : chiffres auto-déclarés, harness hétérogènes. Référence directionnelle, pas verdict d achat.

Tarifs API ($/M tokens, 2026-07-16)
Modèle Entrée Sortie Entrée cache hit Contexte
Kimi K3 $3.00 $15.00 $0.30 1M
Claude Sonnet 5 $3.00 (promo $2) $15.00 (promo $10) 200K
Claude Opus 4.8 $5.00 $25.00 200K
GPT-5.5 $5.00 $30.00 400K
DeepSeek V4 Pro $1.74 $3.48 $0.145 128K
Kimi K2.6 $0.95 $4.00 $0.16 256K

K3 aligné sur Sonnet 5 ($3/$15) avec 5× le contexte. Cache hit $0,30/M ; Moonshot annonce >90 % de hits en coding. Chine : ¥20/M entrée, ¥100/M sortie, cache ¥2/M. Compte gratuit kimi.com, prépayé ¥199 (jusqu au 11 août).

Quatre voies immédiates :

  • Web/App Kimi : kimi.com, compte Google, raisonnement max, sans carte.
  • API officielle : clé sur platform.kimi.ai, modèle kimi-k3, compatible OpenAI.
  • OpenRouter : moonshotai/kimi-k3, tarif officiel, contexte 1M complet.
  • 27 juillet : poids Hugging Face — production 64+ GPU.
kimi_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analyse ce code..."}]
)
  1. Cadrer la tâche : matrice benchmarks — SWE Marathon, bugs repo, agent terminal, documents multimodaux.
  2. Tester kimi.com : prompts types, vision et long contexte.
  3. Clé API : platform.kimi.ai, alertes usage, tarifs ¥20/¥100/¥2.
  4. SDK OpenAI : base_url vers https://api.moonshot.ai/v1, modèle kimi-k3 ; ou OpenRouter.
  5. Cache : préfixes stables pour architecture Mooncake — coût effectif ~$0,55/M.
  6. Surface d'exécution fixe : Xcode, Fastlane, routage multi-modèles sur Apple Silicon bare metal 7×24 — validation API et CI/CD iOS sur la même machine ; ne pas lier la cadence iOS à 64+ GPU avant le 27 juillet. Voir NOVAKVM ci-dessous.
Matrice de choix Kimi K3
Scénario Modèle Pourquoi
Sessions code longues (SWE Marathon) Kimi K3 Leader benchmark, contexte maximal
Bugs complexes en grand repo Claude Fable 5 FrontierSWE en avance
Agents terminal/outils GPT-5.6 Sol Terminal Bench 2.1
Documents longs / multimodaux Kimi K3 OmniDocBench #1, vision + 1M
Budget serré DeepSeek V4 Pro Sortie $3,48/M
Self-host open (après 27/7) Kimi K3 Poids open les plus capables, 2,8T

Moonshot s engage à publier les poids complets le 27 juillet 2026. Premier modèle téléchargeable au-delà de 2T, nouvelle base fine-tuning open. Variantes MXFP4/NVFP4 sur Hugging Face ; support vLLM, SGLang attendu dès J0.

2,8T ≠ déploiement grand public. Inférence production : supernœud 64+ accélérateurs (NVIDIA H100).

Jalons Kimi K3
Date Événement
16 juillet 2026 API en ligne, bannière docs et tarifs
17–20 juillet 2026 WAIC Shanghai
27 juillet 2026 Poids complets sur Hugging Face
11 août 2026 Fin promo prépayé ¥199

Jalons : WAIC 17–20 juilletpoids 27 juillet.

  • Paramètres : 2,8T, MoE 896/16, sparsité 1,8 %.
  • KDA : 3:1 linéaire/complet, KV −75 %, décodage ×6,3 à 1M.
  • AttnRes : ~+25 % efficacité entraînement, compute <2 %.
  • Scaling : ~×2,5 vs Kimi K2.
  • Intelligence Index v4.1 : 57,1, 4e mondial.
  • API : $3/$15, cache $0,30 ; Chine ¥20/¥100/¥2.

FAQ :

  • Gratuit ? Oui sur kimi.com ; API payante $3/$15 par 1M tokens.
  • Local ? Pas avant le 27/7 ; ensuite 64+ GPU en prod. Mac Mini ne suffit pas pour 2,8T.
  • Vs DeepSeek V4 Pro ? 2,8T vs 1,6T, 1M vs 128K, benchmarks supérieurs — sortie DeepSeek $3,48/M.
  • 1M tokens utile ? Oui pour repo entier, docs juridiques, agents longue mémoire — tarif flat.
  • Benchmarks fiables ? Auto-déclarés — A/B sur vos tâches.
  • Modes low/high ? Annoncés ; seul max disponible.

Kimi K3 n'est pas du paramétrique de façade : KDA, AttnRes et Stable LatentMoE apportent une vraie ingénierie. Pas victoire sur tous les benchmarks — Fable 5 et GPT-5.6 Sol dominent certains coding/reasoning — mais le duo 1M tokens + tarif Sonnet reste distinctif pour les workflows créatifs et mobile sur Apple Silicon.

Références — rouvrir après mises à jour :

Blog officiel Moonshot : Kimi K3

Kimi API Platform

OpenRouter : moonshotai/kimi-k3

Artificial Analysis Intelligence Index

SCMP : Moonshot AI releases Kimi K3

VentureBeat : Kimi K3 coverage

Lier tests iOS, routage multi-agents et validation API uniquement à un cluster 2,8T ou à des poids Hugging Face indisponibles expose aux coûts 64+ GPU et au vide avant le 27 juillet — l'API seule ne remplace pas une CI Xcode stable 7×24 sur Apple Silicon.

Pour figer une surface Apple Silicon, stabiliser CI/CD iOS et validation agents IA pendant l'adoption de K3 — builds Xcode, Fastlane et automatisation multi-modèles sur Mac Mini bare metal dédié pour appels API K3, pas inférence locale 2,8T — NOVAKVM offre Mac Mini M4 / M4 Pro multi-régions, bande passante fixe, SSH par défaut, idéal pour workflows créatifs Apple et CI iOS. Tarifs, Commander, Centre d'aide.