Wenn Sie als AI-Entwickler oder Engineering Lead Kimi K3 für Integration, Self-Hosting oder kommerziellen Rollout evaluieren, verändert Moonshot AIs Freigabe der vollständigen Gewichte und des technischen Berichts am 27. Juli die Kalkulation für 3T-Klassen-Modelle. Kimi K3 bringt 2,8 Billionen Gesamtparameter, ein 1-Millionen-Token-Kontextfenster und drei offene Infrastruktur-Stacks: MoonEP, FlashKDA und AgentEnv — nur 11 Tage nach dem API-only-Launch. Dieser Artikel deckt Zeitachse, Architektur (KDA / AttnRes / Per-Head Muon), Infra-Releases, SWE-bench- und Artificial-Analysis-Benchmarks, Open-Weight-Lizenzschwellen, API-Preise und einen Sechs-Schritte-Integrationsleitfaden ab. Querverweise: K3-Launch-Review vom 16. Juli, Distillations-Streit, OpenRouter-Juli-Rankings. Preise: Mietpreisseite.
[ SECTION_01 ] // PAIN_POINTS Warum sollten Sie Ihren Modell-Stack nach Kimi K3s Open-Weight-Drop neu bewerten?
Kurzantwort: nein, nicht im strengen Sinne — und Moonshot AI behauptet das auch nicht. Am Abend des 27. Juli 2026 veröffentlichte das chinesische Lab vollständige Gewichte und einen technischen Bericht für ein 2,8-Billionen-Parameter-Mixture-of-Experts-Modell. Der 1,56-TB-Download erreichte innerhalb von dreißig Minuten Platz 1 auf der Hugging-Face-Trending-Liste — das größte jemals vollständig veröffentlichte Open-Weight-Modell.
- Terminologie-Falle: Presseberichte sprechen oft von „Open Source“, OSI-konformes Open Source verlangt jedoch öffentliche Trainingsdaten und eine reproduzierbare Pipeline. K3 veröffentlicht Gewichte, technischen Bericht und Inferenz-Infra — nicht den vollständigen Trainings-Stack.
- Lizenz-Blindspots: Die Custom-Lizenz fügt zwei kommerzielle Schwellen hinzu, die bei K2 fehlten — eine 20-Mio.-USD-MaaS-Umsatzschwelle über 12 Monate und eine 100-Mio.-MAU- bzw. 20-Mio.-USD-Monatsumsatz-Attributionspflicht.
- Self-Hosting-Illusion: Bei 2,8T Parametern und 896 Experten ist K3 für Consumer-Hardware unerreichbar. Moonshot empfiehlt Supernodes mit 64+ Beschleunigern; die meisten Teams routen über API oder OpenRouter.
- Benchmark-Fehldeutung: Unabhängige SWE-bench-Verified-Werte: K3 bei 93,4 % — stark unter Open-Weight-Modellen, aber hinter Claude Opus 5 (97 %) und GPT-5.6 Sol (96,2 %).
- Kosten-Mismatch: K3 kostet laut Intelligence Index etwa 0,95 USD pro Task — günstiger als Claude Fable 5 (~2,40 USD), teurer als GLM-5.2 (~0,47 USD). Es ist die Capability-Ceiling der Open-Weight-Liga, nicht der Value-Pick.
- Geopolitischer Lärm: Tage vor der Gewichts-Freigabe warfen US-Behörden Moonshot industrielle Destillation gegen Anthropics Fable-Modell vor; Chinas Handelsministerium wies dies am 28. Juli als „AI-Hegemonismus“ zurück.
- DSGVO bei Cloud-APIs: Moonshot-API und OpenRouter verarbeiten Prompts auf Anbieter-Infrastruktur — für EU-Teams mit Kundencode oder personenbezogenen Daten vor Produktion AVV, Subprozessor-Liste und Datenstandort mit Legal klären.
Kernbotschaft: Kimi K3 ist die Capability-Ceiling der Open-Weight-Liga, kein Lehrbuch-Open-Source-Projekt. Die meisten Startups können heute darauf shippen; wer K3-Inferenz im großen Stil gegen Moonshots eigene API weiterverkauft, trifft mit der MaaS-Umsatzschwelle eine juristische rote Linie.
11-Tage-Zeitachse vom API-Launch bis zu vollständigen Gewichten:
- 16. Juli (Vorabend WAIC 2026): K3 debütiert auf kimi.com, Kimi Work, Kimi Code und der Kimi API — nur online, Gewichte zurückgehalten.
- 17. Juli: Branchen-Architektur-Deep-Dives; Staatsmedien nennen es das weltweit größte Open-Model nach Parameterzahl.
- 22.–23. Juli: US-China-„Model-Distillation“-Streit eskaliert; White-House-Berater Michael Kratsios wirft Moonshot verdeckte industrielle Destillation vor.
- 27. Juli ~23:00: Vollständige Gewichte, technischer Bericht, MoonEP und AgentEnv erscheinen (FlashKDA war bereits offen).
- 28. Juli: Chinas Handelsministerium antwortet öffentlich; inländische Medien berichten Release-Details.
[ SECTION_02 ] // ARCHITECTURE Kimi K3 Specs und drei Architektur-Entscheidungen, die zählen
K3 skaliert nicht nur ein bestehendes Rezept — Moonshot hat drei langjährige Defaults neu gebaut: Attention, Residual-Verbindungen und Optimizer.
| Spec | Wert |
|---|---|
| Gesamtparameter | 2,8 Billionen |
| Aktive Parameter | ~104 Milliarden |
| Architektur | Mixture-of-Experts (MoE) |
| Experten | 896 geroutet, 16 pro Token aktiviert, plus Shared Experts |
| Attention | Kimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA) |
| Kontextfenster | 1.000.000 Token |
| Multimodalität | Native Vision (ViT-V2, 27 Layer) |
| Gewichtsformat | MXFP4-Gewichte, MXFP8-Aktivierungen (quantization-aware ab SFT) |
| Download-Größe | ~1,56 TB (Hugging Face) |
| Lizenz | Custom — Moonshot nennt es open weight, nicht open source |
Kimi Delta Attention (KDA): Standard-Gated-DeltaNet wendet ein skalares Vergessens-Gate auf einen gesamten Speicherzustand an. KDA ersetzt es durch kanalweises Gating — jede Feature-Dimension erhält eigene Decay-Rate. Als chunkwise Diagonal-Plus-Low-Rank (DPLR) implementiert, verschachtelt K3 KDA mit wenigen vollständigen Global-Attention-(Gated-MLA)-Layern für 1M Token bei niedrigem KV-Cache.
Attention Residuals (AttnRes): Standard-Residuals akkumulieren jede Schicht gleichmäßig — frühe Signale verdünnen sich in der Tiefe. AttnRes aggregiert vorherige Layer selektiv und input-abhängig mit ~25 % höherer Trainingseffizienz bei unter 2 % zusätzlichen Parametern.
Per-Head Muon: Erweitert den Muon-Optimizer auf pro-Attention-Head-Betrieb statt uniform über das gesamte Modell — unsichtbar beim API-Call, aber Teil des Grunds, warum K3 über seine aktive Parameterzahl hinaus performt.
Stable LatentMoE: 896 Experten, 16 pro Token aktiviert (~1,8 % Sparsity), plus Shared Experts. Quantile Balancing und MoonEP beweisen eine mathematische Obergrenze redundanter Experten pro Rank.
[ SECTION_03 ] // INFRA_BENCH Drei Infra-Releases und Benchmark-Rankings für K3
| Technologie | Rolle | Kernzahlen |
|---|---|---|
| MoonEP | MoE-Kommunikationsbibliothek in Extrem-Skala | Dupliziert überlastete Experten für gleiche Token-Zahlen pro Rank; beweist Obergrenze redundanter Experten pro Rank |
| FlashKDA | CUTLASS-basierte KDA-Kernels (zuvor offen) | 1,72x–2,22x schnelleres Prefill auf NVIDIA H20 vs. flash-linear-attention-Baseline; Drop-in via chunk_kda |
| AgentEnv | Firecracker-microVM-Sandbox (mit KVCache.ai) | Paralleles agentisches RL; Moonshot meldet 133 ms Checkpoint, 49 ms Resume, bis 6,5x Memory-Overcommit (nicht unabhängig reproduziert) |
| Modell | Score | Release |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96,2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93,4% | 2026-07-16 |
| Qwen3.7-Max | 79,4% | 2026-05-19 |
| DeepSeek-V4 | 76,2% | 2026-04-23 |
Artificial Analysis Intelligence Index (max reasoning): Claude Fable 5 erreicht 60, GPT-5.6 Sol 59, Kimi K3 ~57 (#3 gesamt, #1 Open-Weight), GLM-5.2 51, DeepSeek V4 Pro 44. K3 führt zudem Arena.ais Frontend Code Arena Leaderboard an.
[ SECTION_04 ] // LICENSE_DEPLOY Open-Weight-Lizenzschwellen und Sechs-Schritte-Integrationsleitfaden
Die Custom-Lizenz enthält zwei kommerzielle Schwellen:
- MaaS-Umsatzschwelle: Wer ein Model-as-a-Service-Geschäft auf K3 betreibt und über 20 Millionen US-Dollar aggregierten Umsatz in 12 Monaten erzielt, braucht eine separate kommerzielle Vereinbarung mit Moonshot.
- Attributions-Schwelle: Produkte mit über 100 Millionen MAU oder 20 Millionen US-Dollar Monatsumsatz müssen „Kimi K3“ prominent in der UI zeigen.
| Token-Typ | Preis |
|---|---|
| Input (Cache Hit) | $0,30 |
| Input (Cache Miss) | $3,00 |
| Output (inkl. Reasoning) | $15,00 |
Moonshots disaggregierte Mooncake-Serving-Architektur hält Cache-Hit-Raten bei typischen Coding-Workloads über 90 % — reale Nutzung liegt näher an 0,30 USD als am 3,00-USD-Input-Headline-Preis.
- Pfad wählen: Self-Host (64+ Beschleuniger) vs. offizielle API vs. OpenRouter. Die meisten Teams sollten API wählen. Siehe OpenRouter-Integrationsleitfaden für Multi-Provider-Abstraktion.
- Lizenz lesen: Hugging-Face-LICENSE herunterladen und prüfen, ob Geschäftsmodell MaaS- oder Attributions-Schwellen auslöst; EU-Teams zusätzlich DSGVO-AVV bei personenbezogenen Prompt-Inhalten.
- API-Client verdrahten: OpenAI-SDK-Client auf Moonshots Endpoint mit Modell-ID
kimi-k3— meist nur Base-URL und API-Key ändern. - Cache-aware Billing designen: Prompts für Mooncake-Cache-Hits auf Coding-Workloads strukturieren und effektive Input-Kosten Richtung 0,30 USD/M drücken.
- Routing schichten: Volumen-Coding auf K3 oder DeepSeek V4 Flash; harte Schritte zu Claude Opus 5 oder GPT-5.6 Sol. Siehe OpenRouter-Juli-Tiering.
- 7×24-Agent-Hosts verankern: Langlaufende Agent-Orchestrierung braucht always-on-macOS-Knoten, keine Laptops mit Lid-Close-Sleep. Siehe Hilfezentrum und Bestellseite.
# OpenAI-SDK-kompatibler Aufruf (Endpoint und Modell-ID vor Produktion gegen offizielle Docs prüfen)
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain Kimi Delta Attention in one paragraph."}]
)
print(response.choices[0].message.content)
[ SECTION_05 ] // FACTS_FAQ Zitierbare Hard Data, FAQ und 7×24-Agent-Hosting-Abschluss
- Parameterzahl: 2,8T gesamt, ~104B aktiv — größtes jemals vollständig veröffentlichtes Open-Weight-Modell (Moonshot Technical Report).
- Download-Größe: ~1,56 TB; #1 auf Hugging Face Trending innerhalb 30 Minuten nach Release.
- SWE-bench Verified: 93,4 % unabhängiger Score — stärkstes Open-Weight-Ergebnis, weiterhin unter Claude Opus 5 mit 97 % (Vals AI, Juli 2026).
- Intelligence Index: ~57 max Tier, #3 gesamt und #1 Open-Weight (Artificial Analysis).
- FlashKDA-Speedup: 1,72x–2,22x Prefill vs. Baseline auf NVIDIA H20 (Moonshot GitHub).
- Cache-Hit-Preis: 0,30 USD/M Input bei Cache Hit vs. 3,00 USD/M Miss; 90 %+ Hit-Raten auf Coding-Workloads (Moonshot).
- Self-Host-Schwelle: 64+ Beschleuniger-Supernodes empfohlen; sieben OpenRouter-Provider hosten K3 bereits.
FAQ-Highlights:
- F: Ist Kimi K3 Open Source? A: Nein nach OSI-Standards. Open-weight: Gewichte und Infra-Tools öffentlich; Trainingsdaten und vollständiger Trainingscode nicht.
- F: Kommerziell nutzbar? A: Ja in den meisten Fällen. MaaS-Umsatz über 20 Mio. USD/12 Monate oder 100 Mio.+ MAU löst Lizenzklauseln aus.
- F: Hardware für Self-Hosting? A: 64+ Beschleuniger empfohlen; API oder OpenRouter ist der praktische Pfad.
- F: Vergleich mit GPT-5.6 und Claude? A: Hinter Top-Closed-Modellen auf SWE-bench, aber Spitze der Open-Weight-Liga.
- F: K3 vs. K2? A: ~3x K2.5-Parameter, neues AttnRes und Per-Head Muon, erweiterter Kontext und Multimodalität, strengere Lizenz.
Quellen zum Zeitpunkt der Erstellung; bei Änderungen upstream gegen Original prüfen.
https://huggingface.co/moonshotai
https://github.com/moonshotai/FlashKDA
Drei Tage nach K3s Release stellte Alibaba — ein Moonshot-Investor — Qwen3.8-Max-Preview mit 2,4 Billionen Parametern vor, weithin als direkte Antwort gelesen. Das Open-Weight-Rennen ist im „3T-Club“ angekommen. Lizenzgrenzen und gestuftes Routing zählen mehr als die „Open Source“-Debatte.
Echte Nachteile alternativer Setups: (1) 1,56-TB-Gewichts-Download plus lokale Inferenz auf einem 16-GB-Laptop sättigt Disk und RAM sofort — kein Routing-Fallback hebt Hardware-Ceilings. (2) Lid-Close-Sleep killt OAuth-Sessions und lange Agent-Batches — das „stärkste Open-Weight-Modell“ kann keine 7×24-Pipeline auf einem Notebook fahren. (3) Ein maxed Mac Studio für K3-Agent-Workflows kaufen und drei Monate idle lassen kostet mehr als elastische Wochenmiete — und 3T-Inferenz gehört auf die API, nicht auf lokale Gewichte.
Für Teams, die dediziertes Apple Silicon, 7×24-Uptime und elastische Tag/Woche/Monat-Skalierung brauchen, um Kimi-K3-API-getriebene Agenten (Hermes, OpenClaw, Kilo Code) neben iOS-CI auf demselben macOS-Host zu betreiben, ist NOVAKVM Mac Mini Bare-Metal-Miete meist der bessere Produktionspfad: sechs Regionen, High-Memory-Tiers, direktes SSH — Moonshot-API für Inferenz, Bare-Metal-macOS für Orchestrierung, ohne die Doppel-Falle aus 64-GPU-Clustern und Laptop-Sleep. Tiers auf der NOVAKVM-Mietpreisseite vergleichen, Trial auf der Bestellseite starten, Remote-Zugang im Hilfezentrum.