Если вы AI-разработчик или технический лид, оценивающий flagship-модели для agent-воркфлоу, FinOps API или миграции провайдера, Qwen3.8-Max Alibaba в GA от 3 августа 2026 задаёт новый темп в китайской frontier-лиге: 2,4 трлн общих параметров, 95 млрд активных, контекст 1M токенов и предварительное 5-е место в Arena text — единственная не-Anthropic модель в топ-8. Параллельно запущен агент «Qwen Office». Статья охватывает двухнедельный таймлайн, ключевые таблицы, архитектуру MoE, сравнение с Kimi K3 / DeepSeek V4-Flash / Claude, спор о метке open source, playbook из шести шагов и FAQ. Перекрёстные ссылки: разбор Kimi K3 open weight, снижение цен GPT-5.6, Apple Intelligence и Qwen. Тарифы: страница цен.
[ SECTION_01 ] // TIMELINE От превью к GA: темп китайского frontier-гонки в августе 2026
- 16 июля: Moonshot выпускает Kimi K3 — 2,8 трлн параметров, 896 экспертов с 16 активными, с техническим отчётом и независимыми бенчмарками.
- 19 июля: Qwen3.8-Max в превью через Token Plan, Qoder и QoderWork по 10 % ожидаемой GA-цены — без числа активных параметров и публичной таблицы скоров; ToS запрещали автоматизированные продакшен-вызовы.
- 27 июля: Kimi K3 публикует веса на Hugging Face плюс MoonEP, FlashKDA и AgentEnv.
- 31 июля: DeepSeek выводит V4-Flash в GA — тот же размер, что V4-Pro, но существенный рост на agent/code-бенчмарках за счёт оптимизации архитектуры и обучения.
- 3 августа: Qwen3.8-Max переходит в GA с полной таблицей скоров; «Qwen Office» отвечает Tencent WorkBuddy и Kimi Work. Акции Alibaba: Гонконг +7 %, листинг в США +4,5 %.
- Ожидается ~10 августа: Qwen3.8-Max и Qwen3.8-27B на Hugging Face и ModelScope — к моменту публикации репозитория, лицензии и точной даты не было.
Главный вывод: Qwen3.8-Max — единственная не-Anthropic модель в топ-8 Arena text, но все скоры из внутренних тестов Alibaba; независимые платформы GA-версию ещё не воспроизвели. «Мировой топ» требует внешнего подтверждения.
Пробелы прозрачности, заметные ещё в превью:
- Активные параметры с задержкой: в превью не раскрывались; 95 млрд объявлены только при GA.
- Запрет продакшена в preview: ToS от 19 июля — независимые тестеры советовали sandbox да, миграцию продакшена нет.
- Метка open source до весов: GA-сайт несёт «Open-Source» — Hugging Face и ModelScope пусты к моменту публикации.
- Непрозрачная методология бенчмарков: PaperBench, QwenSWEBench, RecreationBench — Artificial Analysis GA не проверил независимо.
[ SECTION_02 ] // SPECS Ключевые данные Qwen3.8-Max: что означают 2,4 трлн параметров на практике
| Поле | Значение |
|---|---|
| Дата GA | 3 августа 2026 |
| Всего / активных | 2,4 трлн / 95 млрд |
| Архитектура | Sparse MoE на базе Qwen3.5 + гибридное внимание |
| Контекст | 1M токенов (режим thinking ~983k, лимит вывода ~131k) |
| Модальности | Текст / изображение / видео |
| Цена API | Ввод $2/M, вывод $6/M |
| Arena text (снимок 1 авг.) | 5-е место, 1496 очков (предварительно) |
| Arena vision | 2-е место, после Claude Fable 5 |
| PaperBench (внутри Alibaba) | 93,0 (+28,2 к предшественнику) |
| SWE-bench Pro (внутри Alibaba) | 67,7 (Fable 5: 80,0) |
| Веса | Обещаны «на следующей неделе», к публикации не вышли |
Значения с пометкой «внутри Alibaba» из официальных GA-материалов; Artificial Analysis и Arena.ai к моменту публикации GA не воспроизвели независимо.
Почему MoE + гибридное внимание, а не чистый набор параметров? Sparse MoE держит 2,4 трлн общих при 95 млрд активных — стоимость инференса ближе к моделям сотен миллиардов, а не к полному dense 2,4T. Отсюда ввод $2/M и вывод $6/M — ниже Claude Opus 5 ($5/$25) и Fable 5 ($10/$50).
reasoning_effort в трёх уровнях: low / medium / xhigh (по умолчанию xhigh). Управление через enable_thinking или Anthropic-совместимое поле reasoning.effort.
[ SECTION_03 ] // COMPARE Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude: что подключать?
| Модель | Всего / активных | Цена ввод/вывод за M | Веса | Независимые тесты |
|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | $2 / $6 | Обещаны, не доставлены | Нет для GA |
| Kimi K3 | 2,8T / ~50B | $3 / $15 | Открыты (27 июля) | Artificial Analysis ~57,11 |
| DeepSeek V4-Flash | без изменений vs V4-Pro | таблица неполная | Открыты | 9 agent/code-бенчмарков выше V4-Pro |
| Claude Opus 5 | не раскрыто | $5 / $25 | Закрыта | Вершина Arena |
| Claude Fable 5 | не раскрыто | $10 / $50 | Закрыта | Arena text #1 |
Kimi K3 и DeepSeek рано называют активные параметры (~50B и 49B); Alibaba объявила 95B только при GA — причина критики прозрачности в июле.
В независимом слепом тесте (269 архитектурных файлов, реальные проекты) Kimi K3 набрал 83 балла, превью Qwen3.8-Max — 80. Один уровень, без явного победителя.
Четыре предупреждающих сигнала о метке «open source»:
- Сайт говорит open source, весов нет. Нет репозитория Hugging Face, лицензии, фиксированной даты.
- Все скоры из внутренних фреймворков — PaperBench, QwenSWEBench, RecreationBench.
- Сноска против Fable 5: Alibaba указывает на возможный «fallback routing» — собственная методология не документирована для стороннего воспроизведения.
- Preview без model card: нет активных параметров, нет safety report — независимые тестеры не рекомендовали миграцию в продакшен.
[ SECTION_04 ] // DEPLOY Шесть шагов: от API-теста до agent-продакшена с Qwen3.8-Max
- Выбрать путь: API QwenCloud (двойной протокол OpenAI/Anthropic) vs ожидание весов Qwen3.8-27B. Полная 2,4T-версия требует мульти-нодового дата-центра; большинство команд стартуют с API. См. гид интеграции OpenRouter для абстракции multi-provider.
- Проверить ToS и цены: неявный cache hit $0,25/M, явная запись кэша $2,5/M, чтение кэша $0,17/M.
- Настроить API-клиент: ключ QwenCloud, base URL на endpoint Alibaba; существующие проекты OpenAI или Anthropic SDK — обычно меняют только base URL и ID модели — совместимо с Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw.
- Выбрать reasoning_effort: low/medium/xhigh по глубине задачи; xhigh для сложной agent-оркестрации, low для контроля затрат.
- Слоистый роутинг: объёмный coding на Qwen3.8-Max или DeepSeek V4-Flash; сложные шаги — Claude Opus 5 или GPT-5.6 Sol. См. tiering OpenRouter за июль.
- Закрепить 7×24 agent-хост: длительная оркестрация (Alibaba продемонстрировала 16 дней без вмешательства человека) требует always-on macOS, а не ноутбук в sleep. См. центр помощи и страницу заказа.
# Вызов совместимый с OpenAI SDK (проверьте endpoint и ID модели по официальной документации перед продакшеном)
from openai import OpenAI
client = OpenAI(
api_key="YOUR_QWEN_API_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Explain sparse MoE architecture in one paragraph."}],
extra_body={"enable_thinking": True}
)
print(response.choices[0].message.content)
[ SECTION_05 ] // FACTS_FAQ Цитируемые hard data, отраслевой контекст, FAQ и 7×24 agent-хостинг
- Всего / активных: 2,4 трлн / 95 млрд; стоимость инференса следует активации, а не общему числу (GA Alibaba, 2026-08-03).
- Arena text: 5-е место, 1496 очков, предварительно; единственная не-Anthropic в топ-8 (Arena.ai, снимок 1 августа).
- Ценовое преимущество API: $2/$6 за M — ниже Opus 5 ($5/$25) и Fable 5 ($10/$50).
- Слепой тест: Kimi K3 83 vs превью Qwen3.8-Max 80 на 269 архитектурных файлах (независимая третья сторона).
- Биржа: Alibaba Гонконг +7 %, США +4,5 % в день GA.
- Потребительский сегмент: Qwen питает Apple Intelligence в Китае (сжато локально).
- Веса: Qwen3.8-Max и Qwen3.8-27B анонсированы на ~10 августа; к публикации не вышли.
Отраслевой контекст: 2026 — год триллионных моделей: DeepSeek V4-Pro стартовал в апреле с 1,6T, превью Qwen3.8-Max в июле с 2,4T, Kimi K3 в июле с 2,8T как крупнейший опубликованный open weight. 31 июля DeepSeek V4-Flash показал, что эффективность архитектуры может обойти гонку параметров. OpenAI и Anthropic сообщили об инцидентах безопасности в собственных eval; Белый дом 4 августа обсуждал добровольные фреймворки кибертестирования — контраст с плотностью китайских релизов в ту же неделю.
FAQ кратко:
- В: Можно использовать сейчас? Open source? О: API да через QwenCloud. Веса нет — обещаны на неделю после 3 августа, к публикации не доставлены.
- В: Qwen3.8-Max vs Kimi K3? О: Один уровень в слепом тесте. K3: открытые веса, независимые скоры. Qwen: дешевле API, шире мультимодальность.
- В: Нужен дата-центр для 2,4T? О: Только для полного self-hosting. API следует 95B активных. Qwen3.8-27B — реалистичный локальный путь.
- В: Доверять бенчмаркам Alibaba? О: Ориентир да, финальный вердикт нет. Рекомендуются A/B-тесты на своём стеке.
- В: Влияние на пользователей? О: Более дешёвые flagship API; Apple Intelligence в Китае на Qwen.
Источники на момент написания; при обновлениях upstream сверяйтесь с оригиналами.
https://github.com/qwen-code-dev-bot/oh-my-cli
Реальные минусы альтернатив: (1) Ждать веса 2,4T и инферить локально на ноутбуке 16 ГБ — диск и RAM мгновенно насыщаются; API-роутинг не снимает потолок железа. (2) Sleep при закрытии крышки убивает OAuth и 16-дневные agent-батчи — модель топ-5 Arena не тянет 7×24 pipeline на notebook. (3) Купить Mac Studio для Qwen agent-воркфлоу и простаивать три месяца дороже эластичной недельной аренды — инференс 2,4T на API, macOS только для оркестрации.
Командам, которым нужны выделенный Apple Silicon, аптайм 7×24 и эластичное масштабирование по дням/неделям/месяцам для agent-ов на API Qwen3.8-Max (Qwen Code, OpenClaw, Claude Code) рядом с iOS CI на том же macOS-хосте, аренда bare-metal Mac Mini NOVAKVM обычно лучший продакшен-путь: шесть регионов, high-memory тиры, прямой SSH — API Qwen для инференса, bare-metal macOS для оркестрации, без мульти-нодового кластера и sleep ноутбука. Сравните тиры на странице тарифов NOVAKVM, запустите trial на странице заказа, удалённый доступ в центре помощи.