Si vous êtes développeur IA, responsable d'architecture ou décideur technique, la nuit du 16 juillet 2026 Moonshot AI a affiché discrètement en tête de sa documentation API : Kimi K3 est en ligne. Pas de keynote — mais 2,8 billions (2,8T) de paramètres, le plus grand modèle open source jamais publié. Cet article couvre MoE 896 experts/16 actifs, contexte 1M tokens et vision native, les innovations KDA/AttnRes/Stable LatentMoE, tableaux complets face à Claude Fable 5 et GPT-5.6 Sol, tarifs $3/$15 et ¥20/¥100, quatre voies d'accès immédiat, poids Hugging Face le 27 juillet, et six FAQ. Tarifs nœuds : page tarifs.
[ SECTION_01 ] // OVERVIEW Kimi K3 en bref : lancement discret et fiche technique
Kimi K3 est le plus grand modèle IA open source par nombre de paramètres : 2,8T, soit ~75 % de plus que DeepSeek V4 Pro (1,6T), 2,7× le modèle open de Xiaomi (1,02T) et plus de 7× Alibaba (397B). Architecture MoE sparse : 16 experts activés sur 896 à chaque passe. Contexte 1 048 576 tokens (l'équivalent de cinq romans intégraux) et compréhension native image/vidéo pour le code complexe, le raisonnement long et le travail documentaire.
En une phrase : un IA de code open source multimodale à mémoire très longue, ~40 % moins chère en sortie que Claude Opus 4.8, poids complets le 27 juillet.
Trois freins avant déploiement :
- Auto-hébergement : la production exige un supernœud 64+ accélérateurs — les poids ouverts ne signifient pas exécution sur MacBook.
- Benchmarks auto-déclarés : harness Kimi Code, Codex, Claude Code — reproductions tierces en cours.
- Pas leader partout : FrontierSWE et Terminal Bench 2.1 restent devant chez Fable 5 ou GPT-5.6 Sol — choisir par matrice de tâches.
| Dimension | Kimi K3 |
|---|---|
| Paramètres totaux | 2,8 billions (2,8T) |
| Architecture | KDA + AttnRes + Stable LatentMoE |
| Sparsité MoE | 896 experts, 16 actifs (1,8 %) |
| Fenêtre de contexte | 1 048 576 tokens (1M) |
| Modalités entrée | Texte, image, vidéo |
| ID modèle API | kimi-k3 |
| Poids open source | 27 juillet 2026 sur Hugging Face |
Lancement silencieux et échelle 2,8T : moins un concours de chiffres qu une affirmation technique en phase de commercialisation accélérée.
[ SECTION_02 ] // ARCHITECTURE Après DeepSeek : contexte marché et trois innovations
Moonshot a perdu une part significative du marché face à DeepSeek en 18 mois. K3 est la contre-attaque, calée la veille de la World AI Conference (WAIC) 2026 à Shanghai.
- 9 mois sur 12, Kimi détenait le record open source par taille ;
- ARR (juin 2026) au-delà de 300 M$ ;
- 6e tour de financement cette année, valorisation pre-money 31,5 Md$ ;
- Revenus API >70 % du total, utilisateurs payants à l'étranger +400 %.
Kimi Delta Attention (KDA) — repenser l attention
L attention complète explose quadratiquement ; à 1M tokens le cache KV devient ingérable. KDA alterne attention linéaire et complète en ratio 3:1 :
- Trois couches linéaires pour le local, une complète pour le flux global ;
- Cache KV réduit jusqu à 75 % ;
- Décodage jusqu à 6,3× plus rapide à 1M tokens ;
- Surpasse les baselines full-attention en contexte court, long et en RL.
Attention Residuals (AttnRes) — perte d information en profondeur
- Les résidus classiques diluent les représentations des premières couches ;
- AttnRes permet une récupération sélective des features précoces ;
- ~25 % d'efficacité d'entraînement en plus, coût compute <2 %.
Stable LatentMoE — sparsité extrême stabilisée
896 experts, 16 actifs (1,8 %). Quantile Balancing, Per-Head Muon, SiTU, Gated MLA. Vs Kimi K2 : ~2,5× meilleure efficacité de scaling.
| Technique | Rôle |
|---|---|
| Quantile Balancing | Allocation d experts depuis les quantiles du routeur, sans hyperparamètres fragiles |
| Per-Head Muon | Optimisation par tête d attention — apprentissage adaptatif à grande échelle |
| SiTU | Meilleur contrôle des activations |
| Gated MLA | Sélectivité attention renforcée |
[ SECTION_03 ] // BENCHMARKS Tableaux benchmark et comparaison tarifaire
Benchmarks clés Moonshot (avec GLM-5.2), au 16.07.2026 :
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 12.9 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 91.2 |
| MMMU-Pro (vision) | 81.6 | 81.2 | 83.0 | 78.9 | — |
| OmniDocBench (documents) | 91.1 | 89.8 | 85.8 | 87.9 | — |
SWE Marathon : K3 mène à 42,0 ; Program Bench 77,8 ; FrontierSWE : Fable 5 à 86,6 ; OmniDocBench 91,1 illustre vision + long contexte. Artificial Analysis Intelligence Index v4.1 : K3 57,1 (4e rang), derrière Fable 5 (59,9) et GPT-5.6 Sol (58,9) — écart au leader 2,8 points.
Attention : chiffres auto-déclarés, harness hétérogènes. Référence directionnelle, pas verdict d achat.
| Modèle | Entrée | Sortie | Entrée cache hit | Contexte |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00 (promo $2) | $15.00 (promo $10) | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
K3 aligné sur Sonnet 5 ($3/$15) avec 5× le contexte. Cache hit $0,30/M ; Moonshot annonce >90 % de hits en coding. Chine : ¥20/M entrée, ¥100/M sortie, cache ¥2/M. Compte gratuit kimi.com, prépayé ¥199 (jusqu au 11 août).
[ SECTION_04 ] // ACCESS Quatre accès, six étapes, matrice de scénarios
Quatre voies immédiates :
- Web/App Kimi : kimi.com, compte Google, raisonnement max, sans carte.
- API officielle : clé sur platform.kimi.ai, modèle
kimi-k3, compatible OpenAI. - OpenRouter :
moonshotai/kimi-k3, tarif officiel, contexte 1M complet. - 27 juillet : poids Hugging Face — production 64+ GPU.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Analyse ce code..."}]
)
- Cadrer la tâche : matrice benchmarks — SWE Marathon, bugs repo, agent terminal, documents multimodaux.
- Tester kimi.com : prompts types, vision et long contexte.
- Clé API : platform.kimi.ai, alertes usage, tarifs ¥20/¥100/¥2.
- SDK OpenAI :
base_urlvershttps://api.moonshot.ai/v1, modèlekimi-k3; ou OpenRouter. - Cache : préfixes stables pour architecture Mooncake — coût effectif ~$0,55/M.
- Surface d'exécution fixe : Xcode, Fastlane, routage multi-modèles sur Apple Silicon bare metal 7×24 — validation API et CI/CD iOS sur la même machine ; ne pas lier la cadence iOS à 64+ GPU avant le 27 juillet. Voir NOVAKVM ci-dessous.
| Scénario | Modèle | Pourquoi |
|---|---|---|
| Sessions code longues (SWE Marathon) | Kimi K3 | Leader benchmark, contexte maximal |
| Bugs complexes en grand repo | Claude Fable 5 | FrontierSWE en avance |
| Agents terminal/outils | GPT-5.6 Sol | Terminal Bench 2.1 |
| Documents longs / multimodaux | Kimi K3 | OmniDocBench #1, vision + 1M |
| Budget serré | DeepSeek V4 Pro | Sortie $3,48/M |
| Self-host open (après 27/7) | Kimi K3 | Poids open les plus capables, 2,8T |
[ SECTION_05 ] // OPEN_SOURCE Open source le 27 juillet : ce que changent les poids
Moonshot s engage à publier les poids complets le 27 juillet 2026. Premier modèle téléchargeable au-delà de 2T, nouvelle base fine-tuning open. Variantes MXFP4/NVFP4 sur Hugging Face ; support vLLM, SGLang attendu dès J0.
2,8T ≠ déploiement grand public. Inférence production : supernœud 64+ accélérateurs (NVIDIA H100).
| Date | Événement |
|---|---|
| 16 juillet 2026 | API en ligne, bannière docs et tarifs |
| 17–20 juillet 2026 | WAIC Shanghai |
| 27 juillet 2026 | Poids complets sur Hugging Face |
| 11 août 2026 | Fin promo prépayé ¥199 |
Jalons : WAIC 17–20 juillet → poids 27 juillet.
[ SECTION_06 ] // DATA Données citables, FAQ, synthèse
- Paramètres : 2,8T, MoE 896/16, sparsité 1,8 %.
- KDA : 3:1 linéaire/complet, KV −75 %, décodage ×6,3 à 1M.
- AttnRes : ~+25 % efficacité entraînement, compute <2 %.
- Scaling : ~×2,5 vs Kimi K2.
- Intelligence Index v4.1 : 57,1, 4e mondial.
- API : $3/$15, cache $0,30 ; Chine ¥20/¥100/¥2.
FAQ :
- Gratuit ? Oui sur kimi.com ; API payante $3/$15 par 1M tokens.
- Local ? Pas avant le 27/7 ; ensuite 64+ GPU en prod. Mac Mini ne suffit pas pour 2,8T.
- Vs DeepSeek V4 Pro ? 2,8T vs 1,6T, 1M vs 128K, benchmarks supérieurs — sortie DeepSeek $3,48/M.
- 1M tokens utile ? Oui pour repo entier, docs juridiques, agents longue mémoire — tarif flat.
- Benchmarks fiables ? Auto-déclarés — A/B sur vos tâches.
- Modes low/high ? Annoncés ; seul
maxdisponible.
Kimi K3 n'est pas du paramétrique de façade : KDA, AttnRes et Stable LatentMoE apportent une vraie ingénierie. Pas victoire sur tous les benchmarks — Fable 5 et GPT-5.6 Sol dominent certains coding/reasoning — mais le duo 1M tokens + tarif Sonnet reste distinctif pour les workflows créatifs et mobile sur Apple Silicon.
Références — rouvrir après mises à jour :
Blog officiel Moonshot : Kimi K3
OpenRouter : moonshotai/kimi-k3
Artificial Analysis Intelligence Index
SCMP : Moonshot AI releases Kimi K3
VentureBeat : Kimi K3 coverage
Lier tests iOS, routage multi-agents et validation API uniquement à un cluster 2,8T ou à des poids Hugging Face indisponibles expose aux coûts 64+ GPU et au vide avant le 27 juillet — l'API seule ne remplace pas une CI Xcode stable 7×24 sur Apple Silicon.
Pour figer une surface Apple Silicon, stabiliser CI/CD iOS et validation agents IA pendant l'adoption de K3 — builds Xcode, Fastlane et automatisation multi-modèles sur Mac Mini bare metal dédié pour appels API K3, pas inférence locale 2,8T — NOVAKVM offre Mac Mini M4 / M4 Pro multi-régions, bande passante fixe, SSH par défaut, idéal pour workflows créatifs Apple et CI iOS. Tarifs, Commander, Centre d'aide.