Alibaba Qwen3.8-Max GA:
MoE 2,4T, 5-е место в Arena (предварительно), веса обещаны на следующей неделе

Если вы AI-разработчик или технический лид, оценивающий flagship-модели для agent-воркфлоу, FinOps API или миграции провайдера, Qwen3.8-Max Alibaba в GA от 3 августа 2026 задаёт новый темп в китайской frontier-лиге: 2,4 трлн общих параметров, 95 млрд активных, контекст 1M токенов и предварительное 5-е место в Arena text — единственная не-Anthropic модель в топ-8. Параллельно запущен агент «Qwen Office». Статья охватывает двухнедельный таймлайн, ключевые таблицы, архитектуру MoE, сравнение с Kimi K3 / DeepSeek V4-Flash / Claude, спор о метке open source, playbook из шести шагов и FAQ. Перекрёстные ссылки: разбор Kimi K3 open weight, снижение цен GPT-5.6, Apple Intelligence и Qwen. Тарифы: страница цен.

  • 16 июля: Moonshot выпускает Kimi K3 — 2,8 трлн параметров, 896 экспертов с 16 активными, с техническим отчётом и независимыми бенчмарками.
  • 19 июля: Qwen3.8-Max в превью через Token Plan, Qoder и QoderWork по 10 % ожидаемой GA-цены — без числа активных параметров и публичной таблицы скоров; ToS запрещали автоматизированные продакшен-вызовы.
  • 27 июля: Kimi K3 публикует веса на Hugging Face плюс MoonEP, FlashKDA и AgentEnv.
  • 31 июля: DeepSeek выводит V4-Flash в GA — тот же размер, что V4-Pro, но существенный рост на agent/code-бенчмарках за счёт оптимизации архитектуры и обучения.
  • 3 августа: Qwen3.8-Max переходит в GA с полной таблицей скоров; «Qwen Office» отвечает Tencent WorkBuddy и Kimi Work. Акции Alibaba: Гонконг +7 %, листинг в США +4,5 %.
  • Ожидается ~10 августа: Qwen3.8-Max и Qwen3.8-27B на Hugging Face и ModelScope — к моменту публикации репозитория, лицензии и точной даты не было.

Главный вывод: Qwen3.8-Max — единственная не-Anthropic модель в топ-8 Arena text, но все скоры из внутренних тестов Alibaba; независимые платформы GA-версию ещё не воспроизвели. «Мировой топ» требует внешнего подтверждения.

Пробелы прозрачности, заметные ещё в превью:

  • Активные параметры с задержкой: в превью не раскрывались; 95 млрд объявлены только при GA.
  • Запрет продакшена в preview: ToS от 19 июля — независимые тестеры советовали sandbox да, миграцию продакшена нет.
  • Метка open source до весов: GA-сайт несёт «Open-Source» — Hugging Face и ModelScope пусты к моменту публикации.
  • Непрозрачная методология бенчмарков: PaperBench, QwenSWEBench, RecreationBench — Artificial Analysis GA не проверил независимо.

Qwen3.8-Max — ключевые данные (источник: материалы GA Alibaba, 2026-08-03)
Поле Значение
Дата GA3 августа 2026
Всего / активных2,4 трлн / 95 млрд
АрхитектураSparse MoE на базе Qwen3.5 + гибридное внимание
Контекст1M токенов (режим thinking ~983k, лимит вывода ~131k)
МодальностиТекст / изображение / видео
Цена APIВвод $2/M, вывод $6/M
Arena text (снимок 1 авг.)5-е место, 1496 очков (предварительно)
Arena vision2-е место, после Claude Fable 5
PaperBench (внутри Alibaba)93,0 (+28,2 к предшественнику)
SWE-bench Pro (внутри Alibaba)67,7 (Fable 5: 80,0)
ВесаОбещаны «на следующей неделе», к публикации не вышли

Значения с пометкой «внутри Alibaba» из официальных GA-материалов; Artificial Analysis и Arena.ai к моменту публикации GA не воспроизвели независимо.

Почему MoE + гибридное внимание, а не чистый набор параметров? Sparse MoE держит 2,4 трлн общих при 95 млрд активных — стоимость инференса ближе к моделям сотен миллиардов, а не к полному dense 2,4T. Отсюда ввод $2/M и вывод $6/M — ниже Claude Opus 5 ($5/$25) и Fable 5 ($10/$50).

reasoning_effort в трёх уровнях: low / medium / xhigh (по умолчанию xhigh). Управление через enable_thinking или Anthropic-совместимое поле reasoning.effort.

Сравнение flagship (публичные данные, начало августа 2026)
Модель Всего / активных Цена ввод/вывод за M Веса Независимые тесты
Qwen3.8-Max 2,4T / 95B $2 / $6 Обещаны, не доставлены Нет для GA
Kimi K3 2,8T / ~50B $3 / $15 Открыты (27 июля) Artificial Analysis ~57,11
DeepSeek V4-Flash без изменений vs V4-Pro таблица неполная Открыты 9 agent/code-бенчмарков выше V4-Pro
Claude Opus 5 не раскрыто $5 / $25 Закрыта Вершина Arena
Claude Fable 5 не раскрыто $10 / $50 Закрыта Arena text #1

Kimi K3 и DeepSeek рано называют активные параметры (~50B и 49B); Alibaba объявила 95B только при GA — причина критики прозрачности в июле.

В независимом слепом тесте (269 архитектурных файлов, реальные проекты) Kimi K3 набрал 83 балла, превью Qwen3.8-Max — 80. Один уровень, без явного победителя.

Четыре предупреждающих сигнала о метке «open source»:

  1. Сайт говорит open source, весов нет. Нет репозитория Hugging Face, лицензии, фиксированной даты.
  2. Все скоры из внутренних фреймворков — PaperBench, QwenSWEBench, RecreationBench.
  3. Сноска против Fable 5: Alibaba указывает на возможный «fallback routing» — собственная методология не документирована для стороннего воспроизведения.
  4. Preview без model card: нет активных параметров, нет safety report — независимые тестеры не рекомендовали миграцию в продакшен.

  1. Выбрать путь: API QwenCloud (двойной протокол OpenAI/Anthropic) vs ожидание весов Qwen3.8-27B. Полная 2,4T-версия требует мульти-нодового дата-центра; большинство команд стартуют с API. См. гид интеграции OpenRouter для абстракции multi-provider.
  2. Проверить ToS и цены: неявный cache hit $0,25/M, явная запись кэша $2,5/M, чтение кэша $0,17/M.
  3. Настроить API-клиент: ключ QwenCloud, base URL на endpoint Alibaba; существующие проекты OpenAI или Anthropic SDK — обычно меняют только base URL и ID модели — совместимо с Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw.
  4. Выбрать reasoning_effort: low/medium/xhigh по глубине задачи; xhigh для сложной agent-оркестрации, low для контроля затрат.
  5. Слоистый роутинг: объёмный coding на Qwen3.8-Max или DeepSeek V4-Flash; сложные шаги — Claude Opus 5 или GPT-5.6 Sol. См. tiering OpenRouter за июль.
  6. Закрепить 7×24 agent-хост: длительная оркестрация (Alibaba продемонстрировала 16 дней без вмешательства человека) требует always-on macOS, а не ноутбук в sleep. См. центр помощи и страницу заказа.
qwen3-8-max-api-example.py
# Вызов совместимый с OpenAI SDK (проверьте endpoint и ID модели по официальной документации перед продакшеном)
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_QWEN_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Explain sparse MoE architecture in one paragraph."}],
    extra_body={"enable_thinking": True}
)
print(response.choices[0].message.content)

  • Всего / активных: 2,4 трлн / 95 млрд; стоимость инференса следует активации, а не общему числу (GA Alibaba, 2026-08-03).
  • Arena text: 5-е место, 1496 очков, предварительно; единственная не-Anthropic в топ-8 (Arena.ai, снимок 1 августа).
  • Ценовое преимущество API: $2/$6 за M — ниже Opus 5 ($5/$25) и Fable 5 ($10/$50).
  • Слепой тест: Kimi K3 83 vs превью Qwen3.8-Max 80 на 269 архитектурных файлах (независимая третья сторона).
  • Биржа: Alibaba Гонконг +7 %, США +4,5 % в день GA.
  • Потребительский сегмент: Qwen питает Apple Intelligence в Китае (сжато локально).
  • Веса: Qwen3.8-Max и Qwen3.8-27B анонсированы на ~10 августа; к публикации не вышли.

Отраслевой контекст: 2026 — год триллионных моделей: DeepSeek V4-Pro стартовал в апреле с 1,6T, превью Qwen3.8-Max в июле с 2,4T, Kimi K3 в июле с 2,8T как крупнейший опубликованный open weight. 31 июля DeepSeek V4-Flash показал, что эффективность архитектуры может обойти гонку параметров. OpenAI и Anthropic сообщили об инцидентах безопасности в собственных eval; Белый дом 4 августа обсуждал добровольные фреймворки кибертестирования — контраст с плотностью китайских релизов в ту же неделю.

FAQ кратко:

  • В: Можно использовать сейчас? Open source? О: API да через QwenCloud. Веса нет — обещаны на неделю после 3 августа, к публикации не доставлены.
  • В: Qwen3.8-Max vs Kimi K3? О: Один уровень в слепом тесте. K3: открытые веса, независимые скоры. Qwen: дешевле API, шире мультимодальность.
  • В: Нужен дата-центр для 2,4T? О: Только для полного self-hosting. API следует 95B активных. Qwen3.8-27B — реалистичный локальный путь.
  • В: Доверять бенчмаркам Alibaba? О: Ориентир да, финальный вердикт нет. Рекомендуются A/B-тесты на своём стеке.
  • В: Влияние на пользователей? О: Более дешёвые flagship API; Apple Intelligence в Китае на Qwen.

Источники на момент написания; при обновлениях upstream сверяйтесь с оригиналами.

https://qwen.ai

https://arena.ai

https://github.com/qwen-code-dev-bot/oh-my-cli

Реальные минусы альтернатив: (1) Ждать веса 2,4T и инферить локально на ноутбуке 16 ГБ — диск и RAM мгновенно насыщаются; API-роутинг не снимает потолок железа. (2) Sleep при закрытии крышки убивает OAuth и 16-дневные agent-батчи — модель топ-5 Arena не тянет 7×24 pipeline на notebook. (3) Купить Mac Studio для Qwen agent-воркфлоу и простаивать три месяца дороже эластичной недельной аренды — инференс 2,4T на API, macOS только для оркестрации.

Командам, которым нужны выделенный Apple Silicon, аптайм 7×24 и эластичное масштабирование по дням/неделям/месяцам для agent-ов на API Qwen3.8-Max (Qwen Code, OpenClaw, Claude Code) рядом с iOS CI на том же macOS-хосте, аренда bare-metal Mac Mini NOVAKVM обычно лучший продакшен-путь: шесть регионов, high-memory тиры, прямой SSH — API Qwen для инференса, bare-metal macOS для оркестрации, без мульти-нодового кластера и sleep ноутбука. Сравните тиры на странице тарифов NOVAKVM, запустите trial на странице заказа, удалённый доступ в центре помощи.