Kimi K3 est-il open source ?
Le modèle 2,8 billions de paramètres de Moonshot AI

Si vous êtes développeur IA ou responsable technique évaluant Kimi K3 pour intégration, auto-hébergement ou déploiement commercial, la publication des poids complets et du rapport technique par Moonshot AI le 27 juillet modifie l'arbitrage pour les modèles de classe 3T. Kimi K3 atteint 2,8 billions de paramètres totaux avec un contexte d'un million de tokens, plus trois stacks d'infrastructure ouverts : MoonEP, FlashKDA et AgentEnv — seulement 11 jours après le lancement API-only. Cet article couvre la chronologie, l'architecture (KDA / AttnRes / Per-Head Muon), les releases infra, les benchmarks SWE-bench et Artificial Analysis, les seuils de licence open weight, les tarifs API et un guide d'intégration en six étapes. À lire avec notre test de lancement K3 du 16 juillet, la polémique de distillation et les classements OpenRouter de juillet. Tarifs : page tarifs.

Réponse courte : non, pas au sens strict — et Moonshot AI ne prétend pas le contraire. Le soir du 27 juillet 2026, le laboratoire chinois a publié les poids complets et un rapport technique pour un modèle Mixture-of-Experts de 2,8 billions de paramètres. Le téléchargement de 1,56 To a atteint la première place du trending Hugging Face en trente minutes — le plus grand modèle open weight jamais publié en intégralité.

  • Piège terminologique : La presse parle souvent d'« open source », mais l'open source conforme OSI exige données d'entraînement publiques et pipeline reproductible. K3 publie poids, rapport technique et infra d'inférence — pas la stack d'entraînement complète.
  • Angles morts de licence : La licence personnalisée ajoute deux seuils commerciaux absents de K2 — un plafond de revenus Model-as-a-Service de 20 millions de dollars sur 12 mois glissants et une obligation d'attribution à 100 millions de MAU ou 20 millions de dollars de revenus mensuels.
  • Illusion d'auto-hébergement : À 2,8T paramètres et 896 experts, K3 est hors de portée du matériel grand public. Moonshot recommande des supernœuds 64+ accélérateurs ; la plupart des équipes passent par l'API ou OpenRouter.
  • Mauvaise lecture des benchmarks : SWE-bench Verified indépendant place K3 à 93,4 % — solide parmi les open weight, mais derrière Claude Opus 5 (97 %) et GPT-5.6 Sol (96,2 %).
  • Décalage de coût : K3 coûte environ 0,95 $ par tâche sur l'Intelligence Index — moins cher que Claude Fable 5 (~2,40 $) mais plus cher que GLM-5.2 (~0,47 $). C'est le plafond de capacité du segment open weight, pas le choix valeur.
  • Bruit géopolitique : Quelques jours avant les poids, des responsables américains ont accusé Moonshot de distillation industrielle à grande échelle contre le modèle Fable d'Anthropic ; le ministère du Commerce chinois a répondu le 28 juillet en dénonçant un « hégémonisme de l'IA ».

En synthèse : Kimi K3 est le plafond de capacité du segment open weight, pas un projet open source au sens académique. La plupart des startups peuvent l'exploiter aujourd'hui ; si votre modèle économique consiste à revendre l'inférence K3 à grande échelle face à l'API de Moonshot, le seuil de revenus MaaS est votre ligne rouge juridique.

Chronologie de 11 jours du lancement API aux poids complets :

  • 16 juillet (veille du WAIC 2026) : K3 débute sur kimi.com, Kimi Work, Kimi Code et l'API Kimi — en ligne uniquement, poids retenus.
  • 17 juillet : Analyses d'architecture sectorielles ; médias d'État le présentent comme le plus grand modèle ouvert par nombre de paramètres.
  • 22–23 juillet : Escalade du différend US-Chine sur la « distillation de modèles » ; Michael Kratsios, conseiller à la Maison Blanche, accuse Moonshot de distillation industrielle dissimulée.
  • 27 juillet ~23h00 : Poids complets, rapport technique, MoonEP et AgentEnv publiés (FlashKDA était déjà ouvert).
  • 28 juillet : Réponse publique du ministère du Commerce chinois ; médias nationaux couvrent les détails de la release.

K3 ne se contente pas de scaler une recette existante — Moonshot a reconstruit trois composants historiques : l'attention, les connexions résiduelles et l'optimiseur.

Kimi K3 en un coup d'œil
Spécification Valeur
Paramètres totaux2,8 billions
Paramètres actifs~104 milliards
ArchitectureMixture-of-Experts (MoE)
Experts896 routés, 16 activés par token, plus experts partagés
AttentionKimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA)
Fenêtre de contexte1 000 000 tokens
MultimodalitéVision native (ViT-V2, 27 couches)
Format des poidsPoids MXFP4, activations MXFP8 (quantization-aware dès le SFT)
Taille du téléchargement~1,56 To (Hugging Face)
LicencePersonnalisée — Moonshot parle d'open weight, pas d'open source

Kimi Delta Attention (KDA) : Le Gated DeltaNet standard applique un unique gate d'oubli scalaire à tout l'état mémoire. KDA le remplace par un gating canal par canal — chaque dimension de feature possède son propre taux de décroissance. Implémenté en chunkwise Diagonal-Plus-Low-Rank (DPLR), K3 entrelace KDA avec un petit nombre de couches d'attention globale (Gated MLA) pour supporter 1M tokens tout en maintenant un KV cache compact.

Attention Residuals (AttnRes) : Les connexions résiduelles classiques accumulent chaque couche uniformément — le signal des premières couches se dilue en profondeur. AttnRes agrège sélectivement les couches précédentes, de façon dépendante de l'entrée, avec environ 25 % d'efficacité d'entraînement en plus pour moins de 2 % de paramètres ajoutés.

Per-Head Muon : Étend l'optimiseur Muon pour opérer par tête d'attention plutôt que sur l'ensemble du modèle de façon uniforme — invisible à l'appel API, mais partie de l'explication de la performance de K3 au-delà de son nombre de paramètres actifs.

Stable LatentMoE : 896 experts, 16 activés par token (~1,8 % de sparsité), plus experts partagés. Quantile Balancing et MoonEP démontrent une borne supérieure mathématique d'experts redondants par rang.

Stack d'infrastructure ouvert
Technologie Rôle Chiffres clés
MoonEP Bibliothèque de communication MoE à très grande échelle Duplique les experts surchargés pour égaliser les tokens par rang ; borne supérieure d'experts redondants par rang
FlashKDA Kernels KDA basés sur CUTLASS (déjà ouverts) Prefill 1,72x–2,22x plus rapide sur NVIDIA H20 vs baseline flash-linear-attention ; drop-in via chunk_kda
AgentEnv Sandbox microVM Firecracker (avec KVCache.ai) RL agentique parallèle ; Moonshot annonce checkpoint 133 ms, reprise 49 ms, surcommit mémoire jusqu'à 6,5x (non reproduit indépendamment)
SWE-bench Verified (indépendant, Vals AI, juillet 2026)
Modèle Score Release
Claude Opus 597%2026-07-24
GPT-5.6 Sol96,2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393,4%2026-07-16
Qwen3.7-Max79,4%2026-05-19
DeepSeek-V476,2%2026-04-23

Artificial Analysis Intelligence Index (max reasoning) : Claude Fable 5 atteint 60, GPT-5.6 Sol 59, Kimi K3 ~57 (#3 global, #1 open weight), GLM-5.2 51, DeepSeek V4 Pro 44. K3 mène également le leaderboard Frontend Code Arena d'Arena.ai.

La licence personnalisée comporte deux seuils commerciaux :

  1. Seuil de revenus Model-as-a-Service : Si vous ou vos affiliés exploitez un business MaaS sur K3 générant plus de 20 millions de dollars de revenus agrégés sur 12 mois glissants, un accord commercial distinct avec Moonshot est requis.
  2. Seuil d'attribution : Les produits dépassant 100 millions de MAU ou 20 millions de dollars de revenus mensuels doivent afficher « Kimi K3 » de façon visible dans l'interface.
Tarifs API Kimi K3 (par million de tokens)
Type de token Prix
Entrée (cache hit)0,30 $
Entrée (cache miss)3,00 $
Sortie (incl. reasoning)15,00 $

L'architecture de serving disaggregée Mooncake de Moonshot maintient des taux de cache hit supérieurs à 90 % sur les workloads de code typiques — l'usage réel se rapproche de 0,30 $ plutôt que du tarif d'entrée affiché à 3,00 $.

  1. Choisir votre voie : Auto-hébergement (64+ accélérateurs) vs API officielle vs OpenRouter. La plupart des équipes doivent privilégier l'API. Voir notre guide d'intégration OpenRouter pour l'abstraction multi-fournisseur.
  2. Lire la licence : Télécharger la LICENSE Hugging Face et confirmer que votre modèle économique ne déclenche pas les seuils MaaS ou d'attribution.
  3. Brancher le client API : Pointer votre client OpenAI SDK vers l'endpoint Moonshot avec l'ID modèle kimi-k3 — généralement un changement de base URL et de clé API.
  4. Concevoir pour la facturation cache-aware : Structurer les prompts pour maximiser les cache hits Mooncake sur les workloads de code et rapprocher le coût d'entrée effectif de 0,30 $/M.
  5. Superposer le routage : Faire tourner le volume de code sur K3 ou DeepSeek V4 Flash ; escalader les étapes difficiles vers Claude Opus 5 ou GPT-5.6 Sol. Voir le playbook de tiering OpenRouter de juillet.
  6. Ancrer les hôtes agent 7×24 : L'orchestration agent longue durée exige des nœuds macOS toujours actifs, pas des portables qui s'endorment à la fermeture. Voir le centre d'aide et la page de commande.
kimi-k3-api-example.py
# Appel compatible OpenAI SDK (vérifier endpoint et ID modèle contre la doc officielle avant mise en production)
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention in one paragraph."}]
)
print(response.choices[0].message.content)

  • Nombre de paramètres : 2,8T total, ~104B actifs — plus grand modèle open weight jamais publié en intégralité (rapport technique Moonshot).
  • Taille du téléchargement : ~1,56 To ; #1 trending Hugging Face en 30 minutes après la release.
  • SWE-bench Verified : 93,4 % score indépendant — meilleur résultat open weight, toujours sous Claude Opus 5 à 97 % (Vals AI, juillet 2026).
  • Intelligence Index : ~57 tier max, #3 global et #1 open weight (Artificial Analysis).
  • Accélération FlashKDA : prefill 1,72x–2,22x vs baseline sur NVIDIA H20 (GitHub Moonshot).
  • Tarif cache hit : 0,30 $/M entrée en cache hit vs 3,00 $/M miss ; taux de hit 90 %+ sur workloads de code (Moonshot).
  • Seuil d'auto-hébergement : supernœuds 64+ accélérateurs recommandés ; sept fournisseurs OpenRouter hébergent déjà K3.

FAQ essentielles :

  • Q : Kimi K3 est-il open source ? R : Non selon les standards OSI. Open weight : poids et outils infra publics ; données d'entraînement et code complet non.
  • Q : Usage commercial ? R : Oui dans la plupart des cas. Revenus MaaS au-delà de 20 M$/12 mois ou 100 M+ MAU déclenchent des clauses de licence.
  • Q : Infrastructure pour auto-hébergement ? R : 64+ accélérateurs recommandés ; API ou OpenRouter est la voie pragmatique.
  • Q : Comparaison avec GPT-5.6 et Claude ? R : Derrière les meilleurs modèles fermés sur SWE-bench, mais en tête du segment open weight.
  • Q : K3 vs K2 ? R : ~3x les paramètres de K2.5, nouveaux AttnRes et Per-Head Muon, contexte et multimodalité étendus, licence plus stricte.

Sources citées à la date de rédaction ; vérifier auprès des dépôts ou tarifs upstream en cas de changement.

https://api.moonshot.ai/v1

https://huggingface.co/moonshotai

https://github.com/moonshotai/FlashKDA

Trois jours après K3, Alibaba — investisseur de Moonshot — a dévoilé Qwen3.8-Max-Preview à 2,4 billions de paramètres, largement interprété comme une réponse directe. La course open weight entre dans ce que certains appellent le « club des 3T ». Comprendre les limites de licence et le routage par paliers compte plus que le débat sur l'étiquette « open source ».

Inconvénients réels des alternatives : (1) Tenter un téléchargement de 1,56 To plus une inférence locale sur un portable 16 Go sature instantanément disque et RAM — aucun fallback de routage ne lève les plafonds matériels. (2) La mise en veille à fermeture du capot coupe les sessions OAuth et les batches agent longue durée — le « modèle open weight le plus performant » ne peut pas alimenter un pipeline 7×24 sur un notebook. (3) Acheter un Mac Studio maxé pour tester des workflows agent K3 puis le laisser inactif trois mois coûte plus qu'une location hebdomadaire élastique — et l'inférence 3T relève de l'API, pas des poids locaux.

Pour les équipes qui ont besoin d'Apple Silicon dédié, disponibilité 7×24 et montée en charge élastique jour/semaine/mois pour exécuter des agents pilotés par l'API Kimi K3 (Hermes, OpenClaw, Kilo Code) aux côtés de la CI iOS sur le même hôte macOS, la location bare-metal Mac Mini NOVAKVM est généralement la meilleure voie de production : six régions, tiers haute mémoire, SSH direct — API Moonshot pour l'inférence, macOS bare-metal pour l'orchestration, sans le double piège des clusters 64 GPU et du sommeil portable. Comparez les tiers sur la page tarifs NOVAKVM, lancez un essai sur la page de commande, et consultez le centre d'aide pour l'accès distant.