Für AI-Entwickler, Architektur-Verantwortliche und Teams, die Open-Source-LLMs evaluieren, lief Moonshot AI am 16. Juli 2026 um Mitternacht ohne große Keynote — nur ein Banner in der API-Dokumentation: Kimi K3 ist live. Dahinter steckt 2,8 Billionen (2,8T) Parameter, das bislang größte Open-Source-AI-Modell weltweit. Dieser Artikel bündelt MoE 896 Experten/16 aktiv, 1M Token Kontext und native Vision, die drei Architektur-Innovationen KDA/AttnRes/Stable LatentMoE, vollständige Benchmark-Tabellen gegen Claude Fable 5 und GPT-5.6 Sol, Preise $3/$15 sowie ¥20/¥100, vier Zugangswege, die Hugging-Face-Freigabe am 27. Juli und sechs FAQ-Antworten. Node-Tarife: Preisseite.
[ SECTION_01 ] // OVERVIEW Was ist Kimi K3? Stiller Launch und Kerndaten
Kimi K3 ist das größte Open-Source-AI-Modell nach Parametern: 2,8T — rund 75 % mehr als DeepSeek V4 Pro (1,6T), das 2,7-Fache von Xiaomis Open Model (1,02T) und mehr als das Siebenfache von Alibaba (397B). Sparse MoE aktiviert pro Forward Pass 16 von 896 Experten. Dazu 1.048.576 Token Kontext (Größenordnung: fünf vollständige Romane in einem Durchlauf) und native Bild- sowie Video-Eingabe für komplexes Coding, Langdokument-Reasoning und Wissensarbeit.
Kurzfassung: Kimi K3 ist ein Open-Source-Coding-Modell mit nativer Multimodalität und extrem langem Gedächtnis, etwa 40 % günstiger als Claude Opus 4.8 bei Output, vollständige Gewichte ab 27. Juli 2026.
Drei harte Einschränkungen vor dem Rollout:
- Self-Hosting: Produktions-Inferenz braucht 64+ Beschleuniger in einem Supernode — Open Weights bedeuten nicht „läuft auf dem Laptop“.
- Benchmarks: Moonshot nutzte Kimi Code, Codex und Claude Code — unabhängige Reproduktionen laufen noch.
- Kein Allrounder-Sieg: FrontierSWE und Terminal Bench 2.1 führen Claude Fable 5 bzw. GPT-5.6 Sol an — Auswahl nach Task-Matrix, nicht nach Parameterzahl.
| Dimension | Kimi K3 |
|---|---|
| Parameter gesamt | 2,8 Billionen (2,8T) |
| Architektur | KDA + AttnRes + Stable LatentMoE |
| MoE-Sparsity | 896 Experten, 16 aktiv (1,8 %) |
| Kontextfenster | 1.048.576 Token (1M) |
| Eingabe-Modalitäten | Text, Bild, Video |
| API-Modell-ID | kimi-k3 |
| Open Weights | 27. Juli 2026 auf Hugging Face |
Der stille Launch steht im Kontrast zur 2,8T-Skalierung — kein reines Parameter-Theater, sondern ein technisches Signal in der Kommerzialisierungsphase.
[ SECTION_02 ] // ARCHITECTURE Nach dem DeepSeek-Schock: Business-Kontext und drei Innovationen
Moonshot verlor in 18 Monaten spürbar Marktanteile an DeepSeek. K3 ist die Gegenoffensive — terminiert am Vorabend der World AI Conference (WAIC) 2026 in Shanghai.
- 9 von 12 Monaten hielt Kimi den Open-Source-Größenrekord;
- ARR (Juni 2026) über 300 Mio. USD;
- 6. Finanzierungsrunde in diesem Jahr, Pre-Money 31,5 Mrd. USD;
- API-Umsatz über 70 % des Gesamtumsatzes, internationale zahlende Nutzer +400 %.
Kimi Delta Attention (KDA) — Attention neu gedacht
Volle Attention skaliert quadratisch; bei 1M Token wird der KV-Cache untragbar. KDA mischt lineare und volle Attention im Verhältnis 3:1:
- Drei lineare Layer für lokale Sequenzen, eine volle Layer für globalen Informationsfluss;
- KV-Cache bis 75 % kleiner;
- Decoding bei 1M Token bis 6,3× schneller;
- Übertrifft reine Full-Attention-Baselines in Kurz-, Langkontext und RL-Szenarien.
Attention Residuals (AttnRes) — Informationsverlust über Tiefe
- Standard-Residuals verdünnen frühe Repräsentationen in tiefen Layern;
- AttnRes erlaubt selektives Zurückholen hochwertiger früher Features;
- Ca. 25 % höhere Trainingseffizienz, unter 2 % Extra-Compute.
Stable LatentMoE — extreme Sparsity stabil trainieren
896 Experten, 16 aktiv (1,8 % Sparsity). Ergänzend: Quantile Balancing, Per-Head Muon, SiTU, Gated MLA. Gegenüber Kimi K2: ~2,5× bessere Skalierungseffizienz.
| Technik | Funktion |
|---|---|
| Quantile Balancing | Expertenzuweisung direkt aus Router-Quantilen, ohne fragile Heuristiken |
| Per-Head Muon | Pro Attention-Head optimiert — adaptiveres Training in großem Maßstab |
| SiTU | Verbesserte Aktivierungskontrolle |
| Gated MLA | Höhere Attention-Selektivität |
[ SECTION_03 ] // BENCHMARKS Benchmark-Tabellen und Preisvergleich
Moonshots Kern-Benchmarks (inkl. GLM-5.2), Stand 16.07.2026:
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 12.9 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 91.2 |
| MMMU-Pro (Vision) | 81.6 | 81.2 | 83.0 | 78.9 | — |
| OmniDocBench (Dokumente) | 91.1 | 89.8 | 85.8 | 87.9 | — |
SWE Marathon (42,0) führt deutlich; Program Bench knapp vorne (77,8); FrontierSWE dominiert Fable 5 (86,6); OmniDocBench 91,1 zeigt Vision plus Langkontext. Im Artificial Analysis Intelligence Index v4.1 erreicht K3 57,1 Punkte (Rang 4), hinter Claude Fable 5 (59,9) und GPT-5.6 Sol (58,9) — Abstand zur Spitze nur 2,8 Punkte.
Hinweis: Eigene Moonshot-Messungen, unterschiedliche Harnesses. Als Richtwert nutzen, nicht als alleinige Beschaffungsgrundlage.
| Modell | Input | Output | Cache-Hit Input | Kontext |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00 (Promo $2) | $15.00 (Promo $10) | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
K3 kostet wie Claude Sonnet 5 ($3/$15), liefert aber 5× Kontext. Cache-Hits ab $0,30/M; Moonshot meldet in Coding-Szenarien über 90 % Cache-Treffer. China-API: ¥20/M Input, ¥100/M Output, Cache ¥2/M. Kostenloser Zugang über kimi.com, Prepaid ab ¥199 (bis 11. August). Wer Prompts mit Quellcode oder personenbezogenen Daten an Moonshot sendet, sollte Auftragsverarbeitung und Speicherort gegen DSGVO-Anforderungen prüfen — API-Nutzung ersetzt keine eigene Datenschutz-Folgenabschätzung.
[ SECTION_04 ] // ACCESS Vier Zugangswege, sechs Schritte, Szenario-Matrix
Kimi K3 ist sofort über vier Wege erreichbar:
- Web/App: kimi.com, Google-Login, max. Reasoning, keine Kreditkarte.
- Offizielle API: Key auf platform.kimi.ai, Modell
kimi-k3, OpenAI-kompatibel. - OpenRouter:
moonshotai/kimi-k3, offizielle Preise, voller 1M-Kontext. - Ab 27. Juli: Hugging-Face-Gewichte — Produktion braucht 64+ Beschleuniger.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Analysiere diesen Code..."}]
)
- Task abgrenzen: Benchmark-Matrix prüfen — SWE Marathon, Repo-Bugfix, Terminal-Agent oder Dokument-Multimodal.
- kimi.com testen: Typische Prompts, Vision und Langkontext validieren.
- API-Key: platform.kimi.ai, Limits und ¥20/¥100/¥2 bzw. ¥199-Prepaid prüfen.
- SDK:
base_url=https://api.moonshot.ai/v1, Modellkimi-k3; optional OpenRouter. - Cache-Strategie: Wiederholte Prefixe für Mooncake-Architektur — effektive Input-Kosten Richtung $0,55/M.
- Execution Surface fixieren: Xcode, Fastlane und Multi-Model-Agent-Routing auf 7×24 Apple-Silicon-Bare-Metal — API-Tests und iOS-CI/CD auf derselben Maschine; kein iOS-Release-Timing an 64+ GPU bis 27. Juli koppeln. Siehe NOVAKVM unten.
| Szenario | Empfehlung | Grund |
|---|---|---|
| Lange Coding-Sessions (SWE Marathon) | Kimi K3 | Benchmark-Spitze, längster Kontext |
| Komplexe Repo-Bugfixes | Claude Fable 5 | FrontierSWE deutlich vorn |
| Terminal-/Tool-Agenten | GPT-5.6 Sol | Terminal Bench 2.1 führt |
| Langdokumente / Multimodal-Dokumente | Kimi K3 | OmniDocBench #1, Vision + 1M |
| Kostenkritisch | DeepSeek V4 Pro | Output $3,48/M |
| Open Self-Host (ab 27.7.) | Kimi K3 | Stärkste Open Weights, 2,8T |
[ SECTION_05 ] // OPEN_SOURCE Open-Source am 27. Juli: Was Gewichte freigeben bedeutet
Moonshot verspricht per WeChat-Ankündigung volle Gewichte am 27. Juli 2026. Danach: größtes downloadbares Open-Modell, erstes Open-Weight über 2T, neuer Fine-Tuning-Standard. MXFP4/NVFP4 auf Hugging Face; vLLM und SGLang voraussichtlich Day-0.
2,8T ≠ Laptop-Inferenz. Produktion: Supernode mit 64+ Beschleunigern (z. B. NVIDIA H100) — für Inference-Anbieter und gut ausgestattete Labore.
| Datum | Ereignis |
|---|---|
| 16. Juli 2026 | API live, Docs-Banner und Preisseite |
| 17.–20. Juli 2026 | WAIC Shanghai |
| 27. Juli 2026 | Volle Gewichte auf Hugging Face |
| 11. August 2026 | ¥199-Prepaid-Aktion endet |
Meilensteine: WAIC 17.–20. Juli → Gewichte 27. Juli.
[ SECTION_06 ] // DATA Zitierbare Daten, FAQ, Abschluss
- Parameter: 2,8T, MoE 896/16, 1,8 % Sparsity.
- KDA: 3:1 linear/full, KV −75 %, Decoding 6,3× bei 1M.
- AttnRes: ~25 % Trainingseffizienz, <2 % Extra-Compute.
- Skalierung: ~2,5× vs. Kimi K2.
- Intelligence Index v4.1: 57,1, Rang 4 weltweit.
- API: $3/$15, Cache $0,30; China ¥20/¥100/¥2.
FAQ:
- Kostenlos? Ja auf kimi.com; API kostenpflichtig $3/$15 pro 1M Token.
- Lokal? Erst ab 27.7.; dann 64+ GPUs für Produktion. Mac Mini reicht nicht für 2,8T.
- Vs. DeepSeek V4 Pro? 2,8T vs. 1,6T, 1M vs. 128K Kontext, stärkere Benchmarks — aber Output $3,48/M vs. $15/M.
- 1M Token nützlich? Ja für Whole-Repo-Analyse, lange PDFs/Rechtstexte, langlebige Agenten — Flat Pricing ohne Längenzuschlag.
- Benchmarks vertrauenswürdig? Self-reported, Harness uneinheitlich — A/B auf echten Tasks.
- low/high Reasoning? Moonshot kündigt
low/highan; aktuell nurmax.
Kimi K3 ist keine Parameter-Show: KDA, AttnRes und Stable LatentMoE sind echte Engineering-Arbeit. Nicht jeder Benchmark gewonnen — Fable 5 und GPT-5.6 Sol führen selektiv — aber Lang-Coding, Dokumentverständnis, 1M Kontext und Sonnet-Preis bilden ein seltenes Paket.
Primärquellen — nach Updates erneut prüfen:
OpenRouter: moonshotai/kimi-k3
Artificial Analysis Intelligence Index
SCMP: Moonshot AI releases Kimi K3
Wer iOS-Tests, Multi-Model-Agent-Routing und API-Integration nur an ein 2,8T-GPU-Cluster oder noch gesperrte Hugging-Face-Gewichte bindet, riskiert Kosten für 64+ GPUs und ein Zeitfenster bis zum 27. Juli — reine API-Tests ersetzen keinen stabilen 7×24-Xcode-CI auf Apple Silicon.
Für festes Apple-Silicon-Execution-Layer, iOS-CI/CD und AI-Agent-Produktionsvalidierung während des K3-Rollouts — Xcode, Fastlane und Agent-Automatisierung auf dediziertem Bare-Metal Mac Mini für K3-API-Engineering, nicht lokale 2,8T-Inferenz — ist NOVAKVM oft planbarer als ein eigenes GPU-Supernode: Multi-Region Mac Mini M4 / M4 Pro, flexible Laufzeit, feste Bandbreite, SSH standardmäßig. Preise, Bestellen, Hilfezentrum.