Зачем DeepSeek поднял API-цены до 1100%
сразу после китайского open-weight блица

За пять дней три топ-лаборатории КНР сделали ходы, которые на поверхности противоречат друг другу. DeepSeek поднял отдельные API-тиры до 1100%. Alibaba на той же неделе впервые выложила веса 2,4T-флагмана. Zhipu AI выпустила GLM-5.3 и на том же base без retraining прокачала coding-бенчмарки примерно в 6×. Вместе это сигнал: конкуренция уходит с «кто дешевле» на pricing power. Разбор покрывает таймлайн, rate sheet, лицензию Qwen, скоры GLM-5.3, разложение стратегий, head-to-head цены, unverified claims, чеклист из 6 шагов и FAQ. См. также: DeepSeek V4 GA, релиз Qwen3.8-Max, срезы GPT-5.6 Luna. Тарифы узлов: страница цен.

Три вопроса обычно стопорят решение: какая billing-строка несёт заголовок 1100%; open weights — это free commercial use или geo ban; и остаётся ли DeepSeek самым дешёвым frontier-class API. Сначала зафиксируем даты.

Таймлайн open-weight и цен (июль–август 2026)
Дата Событие
16 июля 2026 Moonshot AI открывает веса Kimi K3 (2,8T параметров), US security начинает присматриваться
30 июля 2026 OpenAI режет GPT-5.6 Luna, самый дешёвый тир, на 80%
2–3 августа 2026 Alibaba сначала показывает preview, затем запускает Qwen3.8-Max как hosted API
6–7 августа 2026 OpenAI делает Luna бесплатным дефолтом с unlimited text chats
10 августа 2026 Meta выпускает Muse Glimmer (30B, Apache 2.0) и тизерит open weights для флагмана Muse Spark 1.2
12 августа 2026 Alibaba публикует веса Qwen3.8-2.4T-A95B на Hugging Face / ModelScope; xAI выкатывает Grok 4.6
13 августа 2026 DeepSeek-V4-Pro выходит в GA и анонсирует повышение с 17 августа; Google отдаёт discounted Gemini 3.7 Flash
14 августа 2026 Zhipu выкатывает GLM-5.3 на той же 743B-базе, что GLM-5.2
17 августа 2026, 00:00 по Пекину Новые тарифы DeepSeek вступают в силу

Если отъехать назад, картинка схлопывается. Китайские лабы поднимают цены и открывают веса флагманов; американские режут цены и уводят consumer-слой в free. Это две стороны одной ценовой драки. Китайские финансовые медиа уже зовут внутренний ритм 「一周三更」— три крупных апдейта в неделю — MiniMax H3 крутится в той же ротации, что DeepSeek, Alibaba и Zhipu.

  • Friction 1 — математика заголовка: «11×», «свыше 1100%» и «350%» все верны. Это разные строки: cache-hit input, output и cache-miss input.
  • Friction 2 — лицензионный фольклор: байки, что Alibaba запретила скачивание из США, ЕС, Великобритании и Южной Кореи, — фейк. В опубликованном тексте нет territorial clause. Реальные гейты — выручка и тип продукта.
  • Friction 3 — official больше не cheapest by default: в peak часы официальный API DeepSeek уже дороже части реселлеров (GMI Cloud, Novita и другие сейчас ставят V4 Pro ниже official peak rate).

Новые ставки DeepSeek живы с 00:00 по Пекину 17 августа. Peak: 9:00–12:00 и 14:00–18:00 по Пекину (01:00–04:00 и 06:00–10:00 UTC).

Повышение DeepSeek (за 1M токенов, RMB; официальный анонс, сверка с Wall Street CN, IT Home, V2EX)
Позиция биллинга Было Новый off-peak Новый peak Рост peak
V4-Flash cache hit (input) ¥0.02 ¥0.05 ¥0.10 ~400%
V4-Flash cache miss (input) ¥1.0 ¥1.5 ¥3.0 200%
V4-Flash output ¥2.0 ¥4.5 ¥9.0 350%
V4-Pro cache hit (input) ¥0.025 ¥0.15 ¥0.30 ~1100%
V4-Pro cache miss (input) ¥3.0 ¥4.5 ¥9.0 200%
V4-Pro output ¥6.0 ¥13.5 ¥27.0 350%

Цифра 1100% сидит на peak-hour cache-hit input — тире, который раньше был ближе всего к бесплатному. Output, который ест большую часть реальных счетов, вырос на 350%. Независимый cost-model тяжёлой нагрузки (примерно 84M токенов/месяц, в основном off-peak, половина cache hits) даёт рост ближе к 1.8×.

Qwen3.8-2.4T-A95B (open weights Qwen3.8-Max): ключевые спеки
Spec Деталь
Параметры 2,4T всего, 95B активных на токен (MoE, 512 экспертов, 10 routed + 1 shared)
Контекст 262144 токена native (открытый checkpoint), расширяется до ~1.01M; hosted Max по умолчанию 1M
Каденция релиза Preview 2 августа → API live 3 августа → open weights 12 августа
API-цены (international) $2/M input, $6/M output
Лицензия Не Apache 2.0 — кастомная Qwen3.8-Max License
Почему это важно Первый раз Alibaba открыла веса Max-флагмана; Qwen3.5 / 3.6 / 3.7 Max оставались API-only
GLM-5.3 vs GLM-5.2: тот же base, только post-training (самоотчёт Zhipu; независимого rerun ещё нет)
Benchmark GLM-5.2 GLM-5.3 Дельта
Terminal-Bench 3.0 4.6% 28.3% +23.7 pts
DeepSWE v1.1 46.2% 66.9% +20.7 pts
Agents' Last Exam (CLI) 23.8% 28.5% +4.7 pts
CyberGym 77.2% 84.5% +7.3 pts
AutomationBench 26.2% 48.2% +22.0 pts

На Terminal-Bench 3.0 GLM-5.3 всё ещё отстаёт от GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%). Топ open-weight результат, не outright frontier win.

DeepSeek ещё самый дешёвый frontier-class? (RMB/USD по ~¥7.15/$1)
Модель Input (за 1M токенов) Output (за 1M токенов) Open weights?
DeepSeek V4-Pro (peak) ¥9.0 (~$1.26) ¥27.0 (~$3.78) Нет
DeepSeek V4-Pro (off-peak) ¥4.5 (~$0.63) ¥13.5 (~$1.89) Нет
Qwen3.8-Max (international API) $2.00 $6.00 Да (кастомная лицензия)
OpenAI GPT-5.6 Luna $0.20 $1.20 Нет
Claude Opus 5 (implied, по comparative ratio Alibaba) ~$5.00 ~$25.00 Нет

Даже после повышения DeepSeek V4-Pro off-peak всё ещё заметно ниже Claude Opus 5. Это уже не outright cheapest option. International Qwen3.8-Max и OpenAI Luna оба подрезают DeepSeek off-peak. Формула «китайская модель = самая дешёвая» держалась большую часть 2025 и начало 2026. Как planning assumption она больше не безопасна.

1. DeepSeek: с плоского демпинга на time-of-day pricing — это capacity problem, не strategy pivot. Легко прочитать это как «самая дешёвая китайская модель наконец сдалась margin pressure». Структура тарифа читается иначе: компания вынесла compute-constraints на прайс-лист. Плоская always-cheap цена работала как acquisition, пока GPU-ёмкость успевала. Когда usage ушёл в экспоненту, а ёмкость нет, что-то должно было стать явным. «Поощрять более гибкий scheduling нагрузок» — корпоративный перевод фразы peak-hour compute теперь дефицит. В peak официальный API уже выше нескольких реселлеров. Допущение, что official endpoint всегда самый дешёвый способ крутить DeepSeek, сломано впервые.

2. Alibaba: open weights покупают ecosystem goodwill; кастомная лицензия защищает потолок выручки. Публикация 2,4T checkpoint и своя лицензия — не Apache 2.0 — пришли пакетом. Любой Model-as-a-Service или AI Work Assistant бизнес с выручкой свыше $50 миллионов за любые 12 месяцев обязан торговать отдельную коммерческую лицензию. Продукты с 100M+ MAU или $20M+ месячной выручки должны prominently показывать имя модели. Ставка: забрать international developer mindshare и оставить рычаг против фирм, которые могут собрать конкурирующий inference-бизнес. Это другая ставка, чем Muse Glimmer у Meta под unrestricted Apache 2.0.

Один слух стоит прибить явно. Тезисы, что лицензия банит скачивание из США, ЕС, Великобритании и Южной Кореи, — ложь. В опубликованном LICENSE-файле нет geographic clause. В цикле такой скорости LICENSE-файл — не тред анонса — primary source. Веса лежат в репозитории на Hugging Face и ModelScope.

3. GLM-5.3: нового base нет, есть более жирный post-training bet. Тот же 743B-параметровый base, что у GLM-5.2, без retraining, и скачок примерно в 6× на Terminal-Bench 3.0 (4.6% → 28.3%) за счёт scaling RL-окружений. Пока pretraining scaling laws упираются в diminishing returns, post-training RL scale становится отдельным рычагом с куда более низким cost floor, чем новый foundation. Mid-tier лабы без compute уровня OpenAI всё ещё могут закрывать гэп на agentic и coding бенчмарках.

Что спорно или unverified:

  • Заголовок 1100% точен и неполон. Он относится только к peak-hour cache-hit input. Output — статья, которая доминирует в большинстве реальных счетов — вырос на 350%.
  • Утверждения, что Qwen3.8-Max крутится на in-house чипах Zhenwu M890 и супернодах «Pangu AL128», гуляют в китайских финансовых изданиях. Независимой подтверждения в технической документации Alibaba или third-party бенчмарках нет. Vendor-adjacent, unverified reporting.
  • Заявленное GLM-5.3 обнаружение серьёзной уязвимости в Cursor пришло из VentureBeat и собственного disclosure Zhipu. Технические детали не опубликованы. Vendor-sourced, не independently audited.
  • Репорты, что Министерство коммерции КНР (MOFCOM) готовит ответные export controls на AI или полупроводниковые технологии, спекулятивны и опираются на неподтверждённые медиа, не на official announcement.

Почему это важно: две ценовые войны параллельно. За последний месяц топ-лабы КНР выкатывали релизы в темпе, который внутренние медиа зовут «три апдейта в неделю». Американские лабы на consumer-слое шли в обратную сторону: OpenAI срезала Luna на 80% 30 июля, затем сделала её free и unlimited 6–7 августа; Google 13 августа отдала coding-focused модель за половину цены трёхнедельного предшественника. Китайские лабы открывают веса флагманов и вводят ступенчатый, более высокий прайс на compute-constrained верхнем конце. Американские бегут к free и cheap на consumer-конце.

Есть и геополитический слой. Kimi K3 от Moonshot уже попал под US security scrutiny. Часть аналитиков читает выбор Alibaba открыть 2,4T-флагман именно в этом окне как ход закрепить international mindshare до возможного регуляторного сжатия. Это informed interpretation, не confirmed fact. См. разбор open-weight Kimi K3.

  1. Разрежьте заголовок на billing-строки. Cache-hit input (~1100%), output (350%) и cache-miss input (200%) — отдельные ряды. Не бюджетируйте от одного множителя.
  2. Сверьте official peak с реселлерами. GMI Cloud, Novita и другие листинги против peak-листа DeepSeek. Official больше не default cheapest path.
  3. Читайте LICENSE-файл Qwen, не launch-тред. Подтвердите: geo ban нет. Проверьте, бьёт ли продукт в Model-as-a-Service / AI Work Assistant плюс $50M за любые 12 месяцев, или в 100M MAU / $20M месячной выручки.
  4. Помечайте скоры GLM-5.3 как vendor-run. Terminal-Bench 3.0 на 28.3% без опубликованного независимого rerun. Цитируя Sol 34.6% и Fable 5 33.7%, оставляйте source видимым.
  5. Пересчитайте счёт с off-peak и долей cache-hit. Батчи, evals и ночные agent-лупы — с peak. Для heavy users моделируйте ~1.8×, не 11×.
  6. Self-hosting open weights требует стабильный хост. Длинные evals, agent orchestration и license-compliance логи нуждаются в 7×24 воспроизводимой среде. Laptop sleep и дрейфующие VM ломают audit trail. Поднимите trial node со страниц тарифов и заказа, зафиксируйте versions, текст лицензии и логи.
china-llm-price-war-triage.md
China open-weight + pricing cluster — triage sketch (verify against primary sources)
deepseek  V4-Pro peak cache-hit input ~1100% · output +350% · effective 17 авг 00:00 CST
peak      Пекин 09:00-12:00 и 14:00-18:00 · UTC 01:00-04:00 и 06:00-10:00
qwen      веса 2.4T-A95B live 12 авг · custom license · no geo ban
glm53     тот же 743B base · TB3.0 4.6% → 28.3% · vendor-run, нет 3rd-party rerun
rumor     Zhenwu M890 / Cursor vuln / MOFCOM export controls = unverified

  • DeepSeek V4-Pro peak cache-hit input: ¥0.025 → ¥0.30, около 1100%; output ¥6.0 → ¥27.0, 350%.
  • Qwen3.8-2.4T-A95B: 2,4T total / 95B active; 262144 токена native, ~1.01M extendable; international API $2 / $6.
  • Гейты лицензии Qwen: MaaS / AI Work Assistant свыше $50M за любые 12 месяцев — отдельная лицензия; 100M MAU или $20M месячной выручки — prominent naming; географического бана нет.
  • GLM-5.3: тот же 743B base, что 5.2; Terminal-Bench 3.0 4.6% → 28.3%; всё ещё позади Sol 34.6% и Fable 5 33.7%.
  • Счёт heavy user: third-party modelling ~1.8×, далеко от заголовка 11×.
  • FX-референс: около ¥7.15 / $1, только приближение.

FAQ:

  • Q: DeepSeek ещё дешевле GPT-5.6 или Claude? A: Off-peak всё ещё подрезает Claude Opus 5. Luna ($0.20 / $1.20) и Qwen3.8-Max international ($2 / $6) теперь бьют DeepSeek off-peak хотя бы по одной оси.
  • Q: Можно ли коммерчески бесплатно крутить open weights Qwen3.8-Max? A: Личное и внутреннее — да. Гейт $50M MaaS / AI Work Assistant — единственный крючок.
  • Q: Qwen3.8-Max запрещён для US, EU или UK? A: Нет. В опубликованной лицензии нет geographic restriction.
  • Q: Что изменилось между GLM-5.3 и GLM-5.2? A: Тот же 743B base. Прирост из scaled post-training RL, не из новой foundation.
  • Q: Meta откроет Muse Spark 1.2, а не только Glimmer? A: Пока нет. Glimmer — 30B distill. Spark 1.2 остаётся stated intention.

Primary sources при написании. Перед перепубликацией сверяйте актуальные official pricing и license terms. Пункты, помеченные выше как unverified (отечественные чипы, отчёт об уязвимости Cursor, слухи про export controls), независимо не подтверждены. Цифры отражают публичную информацию на 17 августа 2026.

Официальная страница цен DeepSeek (live-страница — source of truth):

https://api-docs.deepseek.com/quick_start/pricing

Официальные репозитории моделей Alibaba Qwen на Hugging Face:

https://huggingface.co/Qwen

Репозитории моделей ModelScope:

https://www.modelscope.cn/

Официальная техническая страница Zhipu GLM-5.3:

https://z.ai/blog/glm-5.3

Реальные лимиты привычных обходов: бюджетировать от одного множителя 1100% — завышать off-peak heavy-user счета и занижать peak batch shock. Считать веса Qwen Apache 2.0 и поднимать Model-as-a-Service продукт можно влететь в кастомную лицензию. Гонять evals класса 2,4T и длинные agent-лупы на ноутбуке, который уходит в sleep, или на дрейфующей VM, ломает reproducibility и license audit trail.

Командам, которым нужны dedicated Apple Silicon, 7×24 uptime и day/week/month elasticity для open-weight evals, agent orchestration и длинного inference на стабильном macOS-хосте, bare-metal аренда Mac Mini NOVAKVM обычно сильнее production path. Ценовые нарративы оставьте на rate cards вендоров; execution — на resident bare-metal node. Сравните тиры на странице тарифов NOVAKVM, trial на странице заказа, remote sessions — центр помощи.