Ist Kimi K3 Open Source?
Moonshot AIs 2,8-Billionen-Parameter-Modell im Detail

Wenn Sie als AI-Entwickler oder Engineering Lead Kimi K3 für Integration, Self-Hosting oder kommerziellen Rollout evaluieren, verändert Moonshot AIs Freigabe der vollständigen Gewichte und des technischen Berichts am 27. Juli die Kalkulation für 3T-Klassen-Modelle. Kimi K3 bringt 2,8 Billionen Gesamtparameter, ein 1-Millionen-Token-Kontextfenster und drei offene Infrastruktur-Stacks: MoonEP, FlashKDA und AgentEnv — nur 11 Tage nach dem API-only-Launch. Dieser Artikel deckt Zeitachse, Architektur (KDA / AttnRes / Per-Head Muon), Infra-Releases, SWE-bench- und Artificial-Analysis-Benchmarks, Open-Weight-Lizenzschwellen, API-Preise und einen Sechs-Schritte-Integrationsleitfaden ab. Querverweise: K3-Launch-Review vom 16. Juli, Distillations-Streit, OpenRouter-Juli-Rankings. Preise: Mietpreisseite.

Kurzantwort: nein, nicht im strengen Sinne — und Moonshot AI behauptet das auch nicht. Am Abend des 27. Juli 2026 veröffentlichte das chinesische Lab vollständige Gewichte und einen technischen Bericht für ein 2,8-Billionen-Parameter-Mixture-of-Experts-Modell. Der 1,56-TB-Download erreichte innerhalb von dreißig Minuten Platz 1 auf der Hugging-Face-Trending-Liste — das größte jemals vollständig veröffentlichte Open-Weight-Modell.

  • Terminologie-Falle: Presseberichte sprechen oft von „Open Source“, OSI-konformes Open Source verlangt jedoch öffentliche Trainingsdaten und eine reproduzierbare Pipeline. K3 veröffentlicht Gewichte, technischen Bericht und Inferenz-Infra — nicht den vollständigen Trainings-Stack.
  • Lizenz-Blindspots: Die Custom-Lizenz fügt zwei kommerzielle Schwellen hinzu, die bei K2 fehlten — eine 20-Mio.-USD-MaaS-Umsatzschwelle über 12 Monate und eine 100-Mio.-MAU- bzw. 20-Mio.-USD-Monatsumsatz-Attributionspflicht.
  • Self-Hosting-Illusion: Bei 2,8T Parametern und 896 Experten ist K3 für Consumer-Hardware unerreichbar. Moonshot empfiehlt Supernodes mit 64+ Beschleunigern; die meisten Teams routen über API oder OpenRouter.
  • Benchmark-Fehldeutung: Unabhängige SWE-bench-Verified-Werte: K3 bei 93,4 % — stark unter Open-Weight-Modellen, aber hinter Claude Opus 5 (97 %) und GPT-5.6 Sol (96,2 %).
  • Kosten-Mismatch: K3 kostet laut Intelligence Index etwa 0,95 USD pro Task — günstiger als Claude Fable 5 (~2,40 USD), teurer als GLM-5.2 (~0,47 USD). Es ist die Capability-Ceiling der Open-Weight-Liga, nicht der Value-Pick.
  • Geopolitischer Lärm: Tage vor der Gewichts-Freigabe warfen US-Behörden Moonshot industrielle Destillation gegen Anthropics Fable-Modell vor; Chinas Handelsministerium wies dies am 28. Juli als „AI-Hegemonismus“ zurück.
  • DSGVO bei Cloud-APIs: Moonshot-API und OpenRouter verarbeiten Prompts auf Anbieter-Infrastruktur — für EU-Teams mit Kundencode oder personenbezogenen Daten vor Produktion AVV, Subprozessor-Liste und Datenstandort mit Legal klären.

Kernbotschaft: Kimi K3 ist die Capability-Ceiling der Open-Weight-Liga, kein Lehrbuch-Open-Source-Projekt. Die meisten Startups können heute darauf shippen; wer K3-Inferenz im großen Stil gegen Moonshots eigene API weiterverkauft, trifft mit der MaaS-Umsatzschwelle eine juristische rote Linie.

11-Tage-Zeitachse vom API-Launch bis zu vollständigen Gewichten:

  • 16. Juli (Vorabend WAIC 2026): K3 debütiert auf kimi.com, Kimi Work, Kimi Code und der Kimi API — nur online, Gewichte zurückgehalten.
  • 17. Juli: Branchen-Architektur-Deep-Dives; Staatsmedien nennen es das weltweit größte Open-Model nach Parameterzahl.
  • 22.–23. Juli: US-China-„Model-Distillation“-Streit eskaliert; White-House-Berater Michael Kratsios wirft Moonshot verdeckte industrielle Destillation vor.
  • 27. Juli ~23:00: Vollständige Gewichte, technischer Bericht, MoonEP und AgentEnv erscheinen (FlashKDA war bereits offen).
  • 28. Juli: Chinas Handelsministerium antwortet öffentlich; inländische Medien berichten Release-Details.

K3 skaliert nicht nur ein bestehendes Rezept — Moonshot hat drei langjährige Defaults neu gebaut: Attention, Residual-Verbindungen und Optimizer.

Kimi K3 auf einen Blick
Spec Wert
Gesamtparameter2,8 Billionen
Aktive Parameter~104 Milliarden
ArchitekturMixture-of-Experts (MoE)
Experten896 geroutet, 16 pro Token aktiviert, plus Shared Experts
AttentionKimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA)
Kontextfenster1.000.000 Token
MultimodalitätNative Vision (ViT-V2, 27 Layer)
GewichtsformatMXFP4-Gewichte, MXFP8-Aktivierungen (quantization-aware ab SFT)
Download-Größe~1,56 TB (Hugging Face)
LizenzCustom — Moonshot nennt es open weight, nicht open source

Kimi Delta Attention (KDA): Standard-Gated-DeltaNet wendet ein skalares Vergessens-Gate auf einen gesamten Speicherzustand an. KDA ersetzt es durch kanalweises Gating — jede Feature-Dimension erhält eigene Decay-Rate. Als chunkwise Diagonal-Plus-Low-Rank (DPLR) implementiert, verschachtelt K3 KDA mit wenigen vollständigen Global-Attention-(Gated-MLA)-Layern für 1M Token bei niedrigem KV-Cache.

Attention Residuals (AttnRes): Standard-Residuals akkumulieren jede Schicht gleichmäßig — frühe Signale verdünnen sich in der Tiefe. AttnRes aggregiert vorherige Layer selektiv und input-abhängig mit ~25 % höherer Trainingseffizienz bei unter 2 % zusätzlichen Parametern.

Per-Head Muon: Erweitert den Muon-Optimizer auf pro-Attention-Head-Betrieb statt uniform über das gesamte Modell — unsichtbar beim API-Call, aber Teil des Grunds, warum K3 über seine aktive Parameterzahl hinaus performt.

Stable LatentMoE: 896 Experten, 16 pro Token aktiviert (~1,8 % Sparsity), plus Shared Experts. Quantile Balancing und MoonEP beweisen eine mathematische Obergrenze redundanter Experten pro Rank.

Offener Infrastruktur-Stack
Technologie Rolle Kernzahlen
MoonEP MoE-Kommunikationsbibliothek in Extrem-Skala Dupliziert überlastete Experten für gleiche Token-Zahlen pro Rank; beweist Obergrenze redundanter Experten pro Rank
FlashKDA CUTLASS-basierte KDA-Kernels (zuvor offen) 1,72x–2,22x schnelleres Prefill auf NVIDIA H20 vs. flash-linear-attention-Baseline; Drop-in via chunk_kda
AgentEnv Firecracker-microVM-Sandbox (mit KVCache.ai) Paralleles agentisches RL; Moonshot meldet 133 ms Checkpoint, 49 ms Resume, bis 6,5x Memory-Overcommit (nicht unabhängig reproduziert)
SWE-bench Verified (unabhängig, Vals AI, Juli 2026)
Modell Score Release
Claude Opus 597%2026-07-24
GPT-5.6 Sol96,2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393,4%2026-07-16
Qwen3.7-Max79,4%2026-05-19
DeepSeek-V476,2%2026-04-23

Artificial Analysis Intelligence Index (max reasoning): Claude Fable 5 erreicht 60, GPT-5.6 Sol 59, Kimi K3 ~57 (#3 gesamt, #1 Open-Weight), GLM-5.2 51, DeepSeek V4 Pro 44. K3 führt zudem Arena.ais Frontend Code Arena Leaderboard an.

Die Custom-Lizenz enthält zwei kommerzielle Schwellen:

  1. MaaS-Umsatzschwelle: Wer ein Model-as-a-Service-Geschäft auf K3 betreibt und über 20 Millionen US-Dollar aggregierten Umsatz in 12 Monaten erzielt, braucht eine separate kommerzielle Vereinbarung mit Moonshot.
  2. Attributions-Schwelle: Produkte mit über 100 Millionen MAU oder 20 Millionen US-Dollar Monatsumsatz müssen „Kimi K3“ prominent in der UI zeigen.
Kimi K3 API-Preise (pro Million Token)
Token-Typ Preis
Input (Cache Hit)$0,30
Input (Cache Miss)$3,00
Output (inkl. Reasoning)$15,00

Moonshots disaggregierte Mooncake-Serving-Architektur hält Cache-Hit-Raten bei typischen Coding-Workloads über 90 % — reale Nutzung liegt näher an 0,30 USD als am 3,00-USD-Input-Headline-Preis.

  1. Pfad wählen: Self-Host (64+ Beschleuniger) vs. offizielle API vs. OpenRouter. Die meisten Teams sollten API wählen. Siehe OpenRouter-Integrationsleitfaden für Multi-Provider-Abstraktion.
  2. Lizenz lesen: Hugging-Face-LICENSE herunterladen und prüfen, ob Geschäftsmodell MaaS- oder Attributions-Schwellen auslöst; EU-Teams zusätzlich DSGVO-AVV bei personenbezogenen Prompt-Inhalten.
  3. API-Client verdrahten: OpenAI-SDK-Client auf Moonshots Endpoint mit Modell-ID kimi-k3 — meist nur Base-URL und API-Key ändern.
  4. Cache-aware Billing designen: Prompts für Mooncake-Cache-Hits auf Coding-Workloads strukturieren und effektive Input-Kosten Richtung 0,30 USD/M drücken.
  5. Routing schichten: Volumen-Coding auf K3 oder DeepSeek V4 Flash; harte Schritte zu Claude Opus 5 oder GPT-5.6 Sol. Siehe OpenRouter-Juli-Tiering.
  6. 7×24-Agent-Hosts verankern: Langlaufende Agent-Orchestrierung braucht always-on-macOS-Knoten, keine Laptops mit Lid-Close-Sleep. Siehe Hilfezentrum und Bestellseite.
kimi-k3-api-example.py
# OpenAI-SDK-kompatibler Aufruf (Endpoint und Modell-ID vor Produktion gegen offizielle Docs prüfen)
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention in one paragraph."}]
)
print(response.choices[0].message.content)

  • Parameterzahl: 2,8T gesamt, ~104B aktiv — größtes jemals vollständig veröffentlichtes Open-Weight-Modell (Moonshot Technical Report).
  • Download-Größe: ~1,56 TB; #1 auf Hugging Face Trending innerhalb 30 Minuten nach Release.
  • SWE-bench Verified: 93,4 % unabhängiger Score — stärkstes Open-Weight-Ergebnis, weiterhin unter Claude Opus 5 mit 97 % (Vals AI, Juli 2026).
  • Intelligence Index: ~57 max Tier, #3 gesamt und #1 Open-Weight (Artificial Analysis).
  • FlashKDA-Speedup: 1,72x–2,22x Prefill vs. Baseline auf NVIDIA H20 (Moonshot GitHub).
  • Cache-Hit-Preis: 0,30 USD/M Input bei Cache Hit vs. 3,00 USD/M Miss; 90 %+ Hit-Raten auf Coding-Workloads (Moonshot).
  • Self-Host-Schwelle: 64+ Beschleuniger-Supernodes empfohlen; sieben OpenRouter-Provider hosten K3 bereits.

FAQ-Highlights:

  • F: Ist Kimi K3 Open Source? A: Nein nach OSI-Standards. Open-weight: Gewichte und Infra-Tools öffentlich; Trainingsdaten und vollständiger Trainingscode nicht.
  • F: Kommerziell nutzbar? A: Ja in den meisten Fällen. MaaS-Umsatz über 20 Mio. USD/12 Monate oder 100 Mio.+ MAU löst Lizenzklauseln aus.
  • F: Hardware für Self-Hosting? A: 64+ Beschleuniger empfohlen; API oder OpenRouter ist der praktische Pfad.
  • F: Vergleich mit GPT-5.6 und Claude? A: Hinter Top-Closed-Modellen auf SWE-bench, aber Spitze der Open-Weight-Liga.
  • F: K3 vs. K2? A: ~3x K2.5-Parameter, neues AttnRes und Per-Head Muon, erweiterter Kontext und Multimodalität, strengere Lizenz.

Quellen zum Zeitpunkt der Erstellung; bei Änderungen upstream gegen Original prüfen.

https://api.moonshot.ai/v1

https://huggingface.co/moonshotai

https://github.com/moonshotai/FlashKDA

Drei Tage nach K3s Release stellte Alibaba — ein Moonshot-Investor — Qwen3.8-Max-Preview mit 2,4 Billionen Parametern vor, weithin als direkte Antwort gelesen. Das Open-Weight-Rennen ist im „3T-Club“ angekommen. Lizenzgrenzen und gestuftes Routing zählen mehr als die „Open Source“-Debatte.

Echte Nachteile alternativer Setups: (1) 1,56-TB-Gewichts-Download plus lokale Inferenz auf einem 16-GB-Laptop sättigt Disk und RAM sofort — kein Routing-Fallback hebt Hardware-Ceilings. (2) Lid-Close-Sleep killt OAuth-Sessions und lange Agent-Batches — das „stärkste Open-Weight-Modell“ kann keine 7×24-Pipeline auf einem Notebook fahren. (3) Ein maxed Mac Studio für K3-Agent-Workflows kaufen und drei Monate idle lassen kostet mehr als elastische Wochenmiete — und 3T-Inferenz gehört auf die API, nicht auf lokale Gewichte.

Für Teams, die dediziertes Apple Silicon, 7×24-Uptime und elastische Tag/Woche/Monat-Skalierung brauchen, um Kimi-K3-API-getriebene Agenten (Hermes, OpenClaw, Kilo Code) neben iOS-CI auf demselben macOS-Host zu betreiben, ist NOVAKVM Mac Mini Bare-Metal-Miete meist der bessere Produktionspfad: sechs Regionen, High-Memory-Tiers, direktes SSH — Moonshot-API für Inferenz, Bare-Metal-macOS für Orchestrierung, ohne die Doppel-Falle aus 64-GPU-Clustern und Laptop-Sleep. Tiers auf der NOVAKVM-Mietpreisseite vergleichen, Trial auf der Bestellseite starten, Remote-Zugang im Hilfezentrum.