Alibaba Qwen3.8-Max GA:
2,4T-Parameter, Arena Top 5 vorläufig, Gewichte nächste Woche versprochen

Wenn Sie als AI-Entwickler oder Engineering Lead Flagship-Modelle für Agent-Workflows, API-FinOps oder Provider-Migration evaluieren, setzt Alibabas Qwen3.8-Max vom 3. August 2026 neue Maßstäbe in der chinesischen Frontier-Liga: 2,4 Billionen Gesamtparameter, 95 Milliarden aktiv, 1M-Token-Kontext und vorläufig Platz 5 in der Arena-Textliga — das einzige Nicht-Anthropic-Modell unter den Top 8. Parallel startete das Agent-Produkt „Qwen Office“. Dieser Artikel deckt Zwei-Wochen-Zeitachse, Kerntabellen, MoE-Architektur, Vergleich mit Kimi K3 / DeepSeek V4-Flash / Claude, die Open-Source-Label-Kontroverse, Sechs-Schritte-Playbook und FAQ ab. Querverweise: Kimi K3 Open-Weight-Analyse, GPT-5.6-Preissenkung, Apple Intelligence und Qwen. Preise: Mietpreisseite.

  • 16. Juli: Moonshot veröffentlicht Kimi K3 — 2,8 Billionen Parameter, 896 Experten mit 16 aktiv, mit technischem Bericht und unabhängigen Benchmarks.
  • 19. Juli: Qwen3.8-Max erscheint als Vorschau über Token Plan, Qoder und QoderWork zu 10 % des erwarteten GA-Preises — ohne aktive Parameterzahl, ohne öffentliche Score-Tabelle; AGB verbieten automatisierte Produktionsaufrufe.
  • 27. Juli: Kimi K3 veröffentlicht Gewichte auf Hugging Face plus MoonEP, FlashKDA und AgentEnv.
  • 31. Juli: DeepSeek bringt V4-Flash GA — gleiche Parameterzahl wie V4-Pro, aber deutliche Sprünge bei Agent- und Code-Benchmarks durch Architektur- und Trainingsoptimierung.
  • 3. August: Qwen3.8-Max erreicht GA mit vollständiger Score-Tabelle; „Qwen Office“ geht live als Antwort auf Tencent WorkBuddy und Kimi Work. Alibaba-Aktien: Hongkong +7 %, US-Listing +4,5 %.
  • Erwartet ~10. August: Qwen3.8-Max und Qwen3.8-27B sollen auf Hugging Face und ModelScope landen — bis Redaktionsschluss kein Repository, keine Lizenz, kein fixes Datum.

Kernbotschaft: Qwen3.8-Max ist das einzige Nicht-Anthropic-Modell unter den Arena-Text-Top-8 — aber alle Scores stammen aus Alibabas eigenen Tests; unabhängige Plattformen haben die GA-Version noch nicht reproduziert. „Weltspitze“ braucht externe Bestätigung.

Transparenzlücken, die schon die Vorschau trafen:

  • Aktive Parameter verspätet: In der Vorschau keine Angabe; erst beim GA: 95 Milliarden aktiv.
  • Produktionsverbot in der Preview: AGB vom 19. Juli untersagten automatisierte Produktions-Calls — unabhängige Tester rieten: Sandbox ja, Migration nein.
  • Open-Source-Label vor den Gewichten: Die GA-Website trägt „Open-Source“ — Hugging Face und ModelScope zeigen bis Redaktionsschluss nichts.
  • Benchmark-Methodik intransparent: PaperBench, QwenSWEBench, RecreationBench — Artificial Analysis hat die GA-Version noch nicht unabhängig verifiziert.
  • DSGVO bei Cloud-API: QwenCloud verarbeitet Prompts auf Alibaba-Infrastruktur. EU-Teams mit Kundencode oder personenbezogenen Daten: vor Produktion AVV, Subprozessorliste und Datenstandort mit Legal klären.

Qwen3.8-Max Kerndaten (Quelle: Alibaba GA-Material, 2026-08-03)
Feld Wert
GA-Datum3. August 2026
Gesamt / aktiv2,4 Billionen / 95 Milliarden
ArchitekturSparse MoE auf Qwen3.5-Basis + Hybrid-Attention
Kontext1M Token (Thinking-Modus ~983k, Output-Cap ~131k)
ModalitätenText / Bild / Video
API-PreisInput $2/M, Output $6/M
Arena Text (Snapshot 1. Aug.)Platz 5, 1496 Punkte (vorläufig)
Arena VisionPlatz 2, hinter Claude Fable 5
PaperBench (Alibaba-intern)93,0 (+28,2 vs. Vorgänger)
SWE-bench Pro (Alibaba-intern)67,7 (Fable 5: 80,0)
Gewichte„Nächste Woche“ versprochen, bis Redaktionsschluss nicht veröffentlicht

Als „Alibaba-intern“ markierte Werte stammen aus offiziellen GA-Materialien; Artificial Analysis und Arena.ai haben die GA-Version zum Redaktionsschluss nicht unabhängig reproduziert.

Warum MoE + Hybrid-Attention statt reiner Parameter-Inflation? Sparse MoE hält 2,4 Billionen Gesamtparameter bei nur 95 Milliarden Aktivierung — Inferenzkosten nähern sich Hundert-Milliarden-Modellen, nicht einem Voll-2,4T-Dense-Stack. Daher Input $2/M und Output $6/M — unter Claude Opus 5 ($5/$25) und Fable 5 ($10/$50).

reasoning_effort in drei Stufen: low / medium / xhigh (Standard xhigh). Steuerung über enable_thinking oder Anthropic-kompatibles reasoning.effort.

Flagship-Vergleich (öffentliche Daten, Anfang August 2026)
Modell Gesamt / aktiv Preis Input/Output pro M Gewichte Unabhängige Tests
Qwen3.8-Max 2,4T / 95B $2 / $6 Versprochen, nicht geliefert Keine für GA
Kimi K3 2,8T / ~50B $3 / $15 Offen (27. Juli) Artificial Analysis ~57,11
DeepSeek V4-Flash unverändert vs. V4-Pro keine vollständige Tabelle Offen 9 Agent/Code-Benchmarks über V4-Pro
Claude Opus 5 nicht veröffentlicht $5 / $25 Geschlossen Arena-Spitze
Claude Fable 5 nicht veröffentlicht $10 / $50 Geschlossen Arena Text #1

Kimi K3 und DeepSeek nennen aktive Parameter früh (~50B bzw. 49B); Alibaba ergänzte 95B erst beim GA — ein Grund für Kritik an mangelnder Transparenz im Juli.

In einem unabhängigen Blindtest (269 Architekturdateien, echte Projekte) erzielte Kimi K3 83 Punkte, Qwen3.8-Max-Vorschau 80 — gleiche Liga, kein klarer Sieger.

Vier Warnsignale beim „Open-Source“-Label:

  1. Website sagt Open-Source, Gewichte fehlen. Kein Hugging-Face-Repo, keine Lizenz, kein fixes Datum.
  2. Alle Scores aus internen Frameworks — PaperBench, QwenSWEBench, RecreationBench.
  3. Footnote gegen Fable 5: Alibaba verweist auf mögliches „fallback routing“ bei Fable — eigene Methodik ist nicht reproduzierbar dokumentiert.
  4. Preview ohne Modellkarte: Keine aktiven Parameter, kein Safety Report — unabhängige Tester rieten von Produktionsmigration ab.

  1. Pfad festlegen: QwenCloud API (OpenAI/Anthropic-Dualprotokoll) vs. Warten auf Qwen3.8-27B-Gewichte. Die 2,4T-Vollversion braucht Multi-Node-Rechenzentren; die meisten Teams starten mit API. Siehe OpenRouter-Integrationsleitfaden für Multi-Provider-Abstraktion.
  2. AGB und Preise prüfen: Impliziter Cache-Hit $0,25/M, explizites Cache-Write $2,5/M, Cache-Read $0,17/M. EU-Teams: DSGVO-AVV vor Produktion mit personenbezogenen Prompts.
  3. API-Client konfigurieren: QwenCloud API-Key, Base-URL auf Alibaba-Endpoint; bestehende OpenAI- oder Anthropic-SDK-Projekte meist nur Base-URL und Modell-ID ändern — kompatibel mit Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw.
  4. reasoning_effort wählen: low/medium/xhigh nach Task-Tiefe; xhigh für komplexe Agent-Orchestrierung, low für Kostenkontrolle.
  5. Gestuftes Routing: Volumen-Coding auf Qwen3.8-Max oder DeepSeek V4-Flash; harte Schritte zu Claude Opus 5 oder GPT-5.6 Sol. Siehe OpenRouter-Juli-Tiering.
  6. 7×24-Agent-Host verankern: Langlaufende Orchestrierung (Alibaba demonstrierte 16 Tage ohne menschlichen Eingriff) braucht always-on-macOS, kein Laptop mit Lid-Close-Sleep. Siehe Hilfezentrum und Bestellseite.
qwen3-8-max-api-example.py
# OpenAI-SDK-kompatibler Aufruf (Endpoint und Modell-ID vor Produktion gegen offizielle Docs prüfen)
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_QWEN_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Explain sparse MoE architecture in one paragraph."}],
    extra_body={"enable_thinking": True}
)
print(response.choices[0].message.content)

  • Gesamt / aktiv: 2,4 Billionen / 95 Milliarden; Inferenzkosten folgen der Aktivierung, nicht der Gesamtzahl (Alibaba GA, 2026-08-03).
  • Arena Text: Platz 5, 1496 Punkte, vorläufig; einziges Nicht-Anthropic-Modell unter Top 8 (Arena.ai, Snapshot 1. August).
  • API-Preisvorteil: $2/$6 pro M — unter Opus 5 ($5/$25) und Fable 5 ($10/$50).
  • Blindtest: Kimi K3 83 vs. Qwen3.8-Max-Vorschau 80 auf 269 Architekturdateien (unabhängiger Dritter).
  • Börse: Alibaba Hongkong +7 %, US +4,5 % am GA-Tag.
  • Consumer: Qwen treibt Apple Intelligence in China (komprimiert lokal).
  • Gewichte: Qwen3.8-Max und Qwen3.8-27B für ~10. August angekündigt; bis Redaktionsschluss nicht veröffentlicht.

Branchenkontext: 2026 ist das Jahr der Billionen-Parameter — DeepSeek V4-Pro startete im April mit 1,6T, Qwen3.8-Max-Vorschau im Juli mit 2,4T, Kimi K3 im Juli mit 2,8T als größtes veröffentlichtes Open-Weight-Modell. Am 31. Juli bewies DeepSeek V4-Flash, dass Architektur-Effizienz Parameter-Wettrüsten schlagen kann. OpenAI und Anthropic meldeten Sicherheitsvorfälle in eigenen Evals; das Weiße Haus beriet am 4. August über freiwillige Cybersecurity-Test-Frameworks — ein Kontrast zur chinesischen Release-Dichte in derselben Woche.

FAQ-Highlights:

  • F: Kann ich Qwen3.8-Max jetzt nutzen? Open source? A: API ja über QwenCloud. Gewichte nein — versprochen für die Woche nach dem 3. August, bis Redaktionsschluss nicht geliefert.
  • F: Qwen3.8-Max vs. Kimi K3? A: Gleiche Liga im Blindtest. K3: Gewichte offen, unabhängige Scores. Qwen: günstigere API, stärkere Multimodalität.
  • F: Brauche ich ein Rechenzentrum für 2,4T? A: Nur für Voll-Self-Hosting. API folgt 95B Aktivierung. Qwen3.8-27B ist der realistische lokale Pfad.
  • F: Alibabas Benchmarks vertrauen? A: Orientierung ja, Endurteil nein. Eigenes A/B-Testing empfohlen.
  • F: Bedeutung für EU-Nutzer? A: Günstigere APIs; DSGVO-Compliance bei Cloud-Prompts mit personenbezogenen Daten vor Produktion klären.

Quellen zum Zeitpunkt der Erstellung; bei Änderungen upstream gegen Original prüfen.

https://qwen.ai

https://arena.ai

https://github.com/qwen-code-dev-bot/oh-my-cli

Echte Nachteile alternativer Setups: (1) Auf einem 16-GB-Laptop auf 2,4T-Gewichte warten und lokal inferieren — Disk und RAM kollabieren sofort; kein API-Routing hebt Hardware-Ceilings. (2) Lid-Close-Sleep killt OAuth und 16-Tage-Agent-Batches — Arena-Top-5-Modelle können keine 7×24-Pipeline auf einem Notebook fahren. (3) Mac Studio kaufen für Qwen-Agent-Workflows und drei Monate idle lassen kostet mehr als Wochenmiete — 2,4T-Inferenz gehört auf die API, macOS nur für Orchestrierung.

Für Teams, die dediziertes Apple Silicon, 7×24-Uptime und elastische Tag/Woche/Monat-Skalierung brauchen, um Qwen3.8-Max-API-getriebene Agenten (Qwen Code, OpenClaw, Claude Code) neben iOS-CI auf demselben macOS-Host zu betreiben, ist NOVAKVM Mac Mini Bare-Metal-Miete meist der bessere Produktionspfad: sechs Regionen, High-Memory-Tiers, direktes SSH — Qwen-API für Inferenz, Bare-Metal-macOS für Orchestrierung, ohne Multi-Node-Cluster und Laptop-Sleep. Tiers auf der NOVAKVM-Mietpreisseite vergleichen, Trial auf der Bestellseite starten, Remote-Zugang im Hilfezentrum.