Kimi K3 im Test: 2,8 Billionen Parameter,
neuer Open-Source-Rekord

Für AI-Entwickler, Architektur-Verantwortliche und Teams, die Open-Source-LLMs evaluieren, lief Moonshot AI am 16. Juli 2026 um Mitternacht ohne große Keynote — nur ein Banner in der API-Dokumentation: Kimi K3 ist live. Dahinter steckt 2,8 Billionen (2,8T) Parameter, das bislang größte Open-Source-AI-Modell weltweit. Dieser Artikel bündelt MoE 896 Experten/16 aktiv, 1M Token Kontext und native Vision, die drei Architektur-Innovationen KDA/AttnRes/Stable LatentMoE, vollständige Benchmark-Tabellen gegen Claude Fable 5 und GPT-5.6 Sol, Preise $3/$15 sowie ¥20/¥100, vier Zugangswege, die Hugging-Face-Freigabe am 27. Juli und sechs FAQ-Antworten. Node-Tarife: Preisseite.

Kimi K3 ist das größte Open-Source-AI-Modell nach Parametern: 2,8T — rund 75 % mehr als DeepSeek V4 Pro (1,6T), das 2,7-Fache von Xiaomis Open Model (1,02T) und mehr als das Siebenfache von Alibaba (397B). Sparse MoE aktiviert pro Forward Pass 16 von 896 Experten. Dazu 1.048.576 Token Kontext (Größenordnung: fünf vollständige Romane in einem Durchlauf) und native Bild- sowie Video-Eingabe für komplexes Coding, Langdokument-Reasoning und Wissensarbeit.

Kurzfassung: Kimi K3 ist ein Open-Source-Coding-Modell mit nativer Multimodalität und extrem langem Gedächtnis, etwa 40 % günstiger als Claude Opus 4.8 bei Output, vollständige Gewichte ab 27. Juli 2026.

Drei harte Einschränkungen vor dem Rollout:

  • Self-Hosting: Produktions-Inferenz braucht 64+ Beschleuniger in einem Supernode — Open Weights bedeuten nicht „läuft auf dem Laptop“.
  • Benchmarks: Moonshot nutzte Kimi Code, Codex und Claude Code — unabhängige Reproduktionen laufen noch.
  • Kein Allrounder-Sieg: FrontierSWE und Terminal Bench 2.1 führen Claude Fable 5 bzw. GPT-5.6 Sol an — Auswahl nach Task-Matrix, nicht nach Parameterzahl.
Kimi K3 Kerndaten
Dimension Kimi K3
Parameter gesamt 2,8 Billionen (2,8T)
Architektur KDA + AttnRes + Stable LatentMoE
MoE-Sparsity 896 Experten, 16 aktiv (1,8 %)
Kontextfenster 1.048.576 Token (1M)
Eingabe-Modalitäten Text, Bild, Video
API-Modell-ID kimi-k3
Open Weights 27. Juli 2026 auf Hugging Face

Der stille Launch steht im Kontrast zur 2,8T-Skalierung — kein reines Parameter-Theater, sondern ein technisches Signal in der Kommerzialisierungsphase.

Moonshot verlor in 18 Monaten spürbar Marktanteile an DeepSeek. K3 ist die Gegenoffensive — terminiert am Vorabend der World AI Conference (WAIC) 2026 in Shanghai.

  • 9 von 12 Monaten hielt Kimi den Open-Source-Größenrekord;
  • ARR (Juni 2026) über 300 Mio. USD;
  • 6. Finanzierungsrunde in diesem Jahr, Pre-Money 31,5 Mrd. USD;
  • API-Umsatz über 70 % des Gesamtumsatzes, internationale zahlende Nutzer +400 %.

Kimi Delta Attention (KDA) — Attention neu gedacht

Volle Attention skaliert quadratisch; bei 1M Token wird der KV-Cache untragbar. KDA mischt lineare und volle Attention im Verhältnis 3:1:

  • Drei lineare Layer für lokale Sequenzen, eine volle Layer für globalen Informationsfluss;
  • KV-Cache bis 75 % kleiner;
  • Decoding bei 1M Token bis 6,3× schneller;
  • Übertrifft reine Full-Attention-Baselines in Kurz-, Langkontext und RL-Szenarien.

Attention Residuals (AttnRes) — Informationsverlust über Tiefe

  • Standard-Residuals verdünnen frühe Repräsentationen in tiefen Layern;
  • AttnRes erlaubt selektives Zurückholen hochwertiger früher Features;
  • Ca. 25 % höhere Trainingseffizienz, unter 2 % Extra-Compute.

Stable LatentMoE — extreme Sparsity stabil trainieren

896 Experten, 16 aktiv (1,8 % Sparsity). Ergänzend: Quantile Balancing, Per-Head Muon, SiTU, Gated MLA. Gegenüber Kimi K2: ~2,5× bessere Skalierungseffizienz.

Stable LatentMoE — begleitende Techniken
Technik Funktion
Quantile Balancing Expertenzuweisung direkt aus Router-Quantilen, ohne fragile Heuristiken
Per-Head Muon Pro Attention-Head optimiert — adaptiveres Training in großem Maßstab
SiTU Verbesserte Aktivierungskontrolle
Gated MLA Höhere Attention-Selektivität

Moonshots Kern-Benchmarks (inkl. GLM-5.2), Stand 16.07.2026:

Kimi K3 vs. Closed/Open Flaggschiffe (Moonshot self-reported)
Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GLM-5.2
DeepSWE 67.5 70.0 73.0 59.0 46.2
Program Bench 77.8 76.8 77.6 71.9 63.7
Terminal Bench 2.1 88.3 84.6 88.8 84.6 82.7
FrontierSWE 81.2 86.6 71.3 66.7 67.3
SWE Marathon 42.0 35.0 39.0 40.0 13.0
BrowseComp 91.2 88.0 90.4 84.3
Automation Bench 30.8 29.1 29.7 27.2 12.9
GPQA-Diamond 93.5 92.6 94.1 91.0 91.2
MMMU-Pro (Vision) 81.6 81.2 83.0 78.9
OmniDocBench (Dokumente) 91.1 89.8 85.8 87.9

SWE Marathon (42,0) führt deutlich; Program Bench knapp vorne (77,8); FrontierSWE dominiert Fable 5 (86,6); OmniDocBench 91,1 zeigt Vision plus Langkontext. Im Artificial Analysis Intelligence Index v4.1 erreicht K3 57,1 Punkte (Rang 4), hinter Claude Fable 5 (59,9) und GPT-5.6 Sol (58,9) — Abstand zur Spitze nur 2,8 Punkte.

Hinweis: Eigene Moonshot-Messungen, unterschiedliche Harnesses. Als Richtwert nutzen, nicht als alleinige Beschaffungsgrundlage.

API-Preise ($/M Token, 16.07.2026)
Modell Input Output Cache-Hit Input Kontext
Kimi K3 $3.00 $15.00 $0.30 1M
Claude Sonnet 5 $3.00 (Promo $2) $15.00 (Promo $10) 200K
Claude Opus 4.8 $5.00 $25.00 200K
GPT-5.5 $5.00 $30.00 400K
DeepSeek V4 Pro $1.74 $3.48 $0.145 128K
Kimi K2.6 $0.95 $4.00 $0.16 256K

K3 kostet wie Claude Sonnet 5 ($3/$15), liefert aber 5× Kontext. Cache-Hits ab $0,30/M; Moonshot meldet in Coding-Szenarien über 90 % Cache-Treffer. China-API: ¥20/M Input, ¥100/M Output, Cache ¥2/M. Kostenloser Zugang über kimi.com, Prepaid ab ¥199 (bis 11. August). Wer Prompts mit Quellcode oder personenbezogenen Daten an Moonshot sendet, sollte Auftragsverarbeitung und Speicherort gegen DSGVO-Anforderungen prüfen — API-Nutzung ersetzt keine eigene Datenschutz-Folgenabschätzung.

Kimi K3 ist sofort über vier Wege erreichbar:

  • Web/App: kimi.com, Google-Login, max. Reasoning, keine Kreditkarte.
  • Offizielle API: Key auf platform.kimi.ai, Modell kimi-k3, OpenAI-kompatibel.
  • OpenRouter: moonshotai/kimi-k3, offizielle Preise, voller 1M-Kontext.
  • Ab 27. Juli: Hugging-Face-Gewichte — Produktion braucht 64+ Beschleuniger.
kimi_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analysiere diesen Code..."}]
)
  1. Task abgrenzen: Benchmark-Matrix prüfen — SWE Marathon, Repo-Bugfix, Terminal-Agent oder Dokument-Multimodal.
  2. kimi.com testen: Typische Prompts, Vision und Langkontext validieren.
  3. API-Key: platform.kimi.ai, Limits und ¥20/¥100/¥2 bzw. ¥199-Prepaid prüfen.
  4. SDK: base_url=https://api.moonshot.ai/v1, Modell kimi-k3; optional OpenRouter.
  5. Cache-Strategie: Wiederholte Prefixe für Mooncake-Architektur — effektive Input-Kosten Richtung $0,55/M.
  6. Execution Surface fixieren: Xcode, Fastlane und Multi-Model-Agent-Routing auf 7×24 Apple-Silicon-Bare-Metal — API-Tests und iOS-CI/CD auf derselben Maschine; kein iOS-Release-Timing an 64+ GPU bis 27. Juli koppeln. Siehe NOVAKVM unten.
Szenario-Auswahl für Kimi K3
Szenario Empfehlung Grund
Lange Coding-Sessions (SWE Marathon) Kimi K3 Benchmark-Spitze, längster Kontext
Komplexe Repo-Bugfixes Claude Fable 5 FrontierSWE deutlich vorn
Terminal-/Tool-Agenten GPT-5.6 Sol Terminal Bench 2.1 führt
Langdokumente / Multimodal-Dokumente Kimi K3 OmniDocBench #1, Vision + 1M
Kostenkritisch DeepSeek V4 Pro Output $3,48/M
Open Self-Host (ab 27.7.) Kimi K3 Stärkste Open Weights, 2,8T

Moonshot verspricht per WeChat-Ankündigung volle Gewichte am 27. Juli 2026. Danach: größtes downloadbares Open-Modell, erstes Open-Weight über 2T, neuer Fine-Tuning-Standard. MXFP4/NVFP4 auf Hugging Face; vLLM und SGLang voraussichtlich Day-0.

2,8T ≠ Laptop-Inferenz. Produktion: Supernode mit 64+ Beschleunigern (z. B. NVIDIA H100) — für Inference-Anbieter und gut ausgestattete Labore.

Kimi K3 Meilensteine
Datum Ereignis
16. Juli 2026 API live, Docs-Banner und Preisseite
17.–20. Juli 2026 WAIC Shanghai
27. Juli 2026 Volle Gewichte auf Hugging Face
11. August 2026 ¥199-Prepaid-Aktion endet

Meilensteine: WAIC 17.–20. JuliGewichte 27. Juli.

  • Parameter: 2,8T, MoE 896/16, 1,8 % Sparsity.
  • KDA: 3:1 linear/full, KV −75 %, Decoding 6,3× bei 1M.
  • AttnRes: ~25 % Trainingseffizienz, <2 % Extra-Compute.
  • Skalierung: ~2,5× vs. Kimi K2.
  • Intelligence Index v4.1: 57,1, Rang 4 weltweit.
  • API: $3/$15, Cache $0,30; China ¥20/¥100/¥2.

FAQ:

  • Kostenlos? Ja auf kimi.com; API kostenpflichtig $3/$15 pro 1M Token.
  • Lokal? Erst ab 27.7.; dann 64+ GPUs für Produktion. Mac Mini reicht nicht für 2,8T.
  • Vs. DeepSeek V4 Pro? 2,8T vs. 1,6T, 1M vs. 128K Kontext, stärkere Benchmarks — aber Output $3,48/M vs. $15/M.
  • 1M Token nützlich? Ja für Whole-Repo-Analyse, lange PDFs/Rechtstexte, langlebige Agenten — Flat Pricing ohne Längenzuschlag.
  • Benchmarks vertrauenswürdig? Self-reported, Harness uneinheitlich — A/B auf echten Tasks.
  • low/high Reasoning? Moonshot kündigt low/high an; aktuell nur max.

Kimi K3 ist keine Parameter-Show: KDA, AttnRes und Stable LatentMoE sind echte Engineering-Arbeit. Nicht jeder Benchmark gewonnen — Fable 5 und GPT-5.6 Sol führen selektiv — aber Lang-Coding, Dokumentverständnis, 1M Kontext und Sonnet-Preis bilden ein seltenes Paket.

Primärquellen — nach Updates erneut prüfen:

Moonshot AI Blog: Kimi K3

Kimi API Platform

OpenRouter: moonshotai/kimi-k3

Artificial Analysis Intelligence Index

SCMP: Moonshot AI releases Kimi K3

VentureBeat: Kimi K3 coverage

Wer iOS-Tests, Multi-Model-Agent-Routing und API-Integration nur an ein 2,8T-GPU-Cluster oder noch gesperrte Hugging-Face-Gewichte bindet, riskiert Kosten für 64+ GPUs und ein Zeitfenster bis zum 27. Juli — reine API-Tests ersetzen keinen stabilen 7×24-Xcode-CI auf Apple Silicon.

Für festes Apple-Silicon-Execution-Layer, iOS-CI/CD und AI-Agent-Produktionsvalidierung während des K3-Rollouts — Xcode, Fastlane und Agent-Automatisierung auf dediziertem Bare-Metal Mac Mini für K3-API-Engineering, nicht lokale 2,8T-Inferenz — ist NOVAKVM oft planbarer als ein eigenes GPU-Supernode: Multi-Region Mac Mini M4 / M4 Pro, flexible Laufzeit, feste Bandbreite, SSH standardmäßig. Preise, Bestellen, Hilfezentrum.