DeepSeek V4 GA: полная версия —
цены, архитектура и сравнение с GPT-5.6

После трёх месяцев ожидания DeepSeek V4 в полной версии (GA) официально вышел 20 июля 2026. По сравнению с preview апреля GA улучшает агентов, математический reasoning и генерацию кода и впервые вводит дифференцированные peak/off-peak тарифы — DeepSeek переходит от «почти бесплатно» к дисциплинированной коммерциализации. Статья для команд на deepseek-chat с обязательной миграцией до 24 июля и для тех, кто выбирает между GPT-5.6, Claude Fable 5 и V4: сначала семь болевых точек, затем хронология, архитектура MoE 1,6T (CSA+HCA, mHC, Muon), бенчмарки, тройное сравнение, таблица peak-цен, чеклист миграции из шести шагов и цитируемые параметры, завершение — self-hosting на Mac и узлы NOVAKVM с большой памятью. Данные: документация DeepSeek и arXiv:2606.19348; ссылки перепроверить после релиза. Цены: страница тарифов, заказ: страница заказа; см. также гайд ds4 local и релиз GPT-5.6.

  • Legacy API отключается: deepseek-chat и deepseek-reasoner навсегда прекращают работу 24 июля 2026, 23:59 (пекинское время). Прод без смены модели получит жёсткий обрыв.
  • Peak/off-peak усложняет планирование: в будни 09:00–12:00 и 14:00–18:00 (Пекин) тарифы удваиваются; agent-pipeline 7×24 без временных окон может раздуть счёт.
  • Pro vs Flash неочевиден: V4-Pro (1,6T / 49B active) и V4-Flash (284B / 13B active) различаются по цене и возможностям; неверный роутинг тратит токены или качество.
  • Closed-source флагманы впереди: Claude Fable 5 — 80,3% на SWE-bench Pro, V4-Pro — 55,4%; «лучший open-source» ≠ «лучшая модель вообще».
  • 1M контекста не бесплатен: KV cache снижен до 10% от V3.2, но длинные agent-контексты всё равно едят RAM и compute; self-hosting от 96 GB+ unified memory (путь ds4).
  • Давление compliance: финансы, медицина, госсектор предпочитают MIT + private deployment; полные веса V4-Pro локально дороги по железу.
  • Три режима inference: Non-think / Think High / Think Max плюс рекомендованные temperature=1.0, top_p=1.0 требуют настройки по сценарию; слепой Think Max повышает latency и cost.

DeepSeek V4 — ключевая хронология (2026)
Дата Событие
24 апреля Preview V4 online и open source (MIT): V4-Pro (1,6T) и V4-Flash (284B)
Май Production tuning, API официально доступен
Июнь Цена output V4-Pro −75% навсегда до $0,87/M tokens
29 июня Email: GA в середине июля, первое объявление peak/off-peak
19 июля Grey GA для части разработчиков, пресса: «полная версия завтра»
20 июля GA полная версия online (дата публикации)
24 июля deepseek-chat / deepseek-reasoner offline навсегда

Кратко: GA улучшает agent, math reasoning и code vs preview и вводит peak/off-peak billing; базовая MoE-архитектура без изменений.

V4-Pro vs V4-Flash — спецификации
Параметр V4-Pro V4-Flash
Всего параметров 1,6 трлн (1,6T) 284 млрд (284B)
Active на token 49 млрд (49B) 13 млрд (13B)
Слои Transformer 61 43
Контекстное окно 1 000 000 tokens 1 000 000 tokens
Max output 384K tokens 384K tokens
Точность FP4 (experts) + FP8 (остальное) FP4 + FP8 mixed
Pretraining data 33T+ tokens 32T+ tokens
Лицензия MIT MIT

Ключевые инновации (контекст 1M):

  • Hybrid attention (CSA + HCA): вместо MLA V2/V3: Compressed Sparse Attention (CSA — KV сжат 4× через Softmax gating, FP4 Lightning Indexer top-k, Pro top-1024 / Flash top-512, sliding window 128 tokens) и Heavy Compressed Attention (HCA — сжатие 128×, затем dense global attention) чередуются. При 1M: 27% FLOPs V3.2, KV cache 10% (Flash 7%).
  • Manifold-Constrained Hyper-Connections (mHC): 4-канальный residual stream + doubly stochastic matrix (Birkhoff polytope) для стабильных градиентов на 61 слое.
  • Muon optimizer: Newton-Schulz ортогонализация градиентов при обучении — быстрее и стабильнее AdamW.
Три режима inference и применение
Режим Особенность Применение
Non-think Без chain-of-thought, максимальная скорость Простые Q&A, routing
Think High Явный reasoning (CoT tags) Средняя сложность, debug кода
Think Max Максимальный reasoning, контекст 384K+ Сложная математика, длинные agent-цепочки

Официальные sampling defaults (все режимы): temperature=1.0, top_p=1.0.

V4-Pro — ключевые результаты (июль 2026)
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80,6% (рекорд open-source) 96,0% не опубликован отдельно ~69%
SWE-bench Pro 55,4% 80,3% 78,1% 69,2%
LiveCodeBench (Pass@1) 93,5% 88,1% 87,4% 83,2%
Codeforces Elo 3 206
Terminal-Bench 2.1 83,9% 88,0% 85,1% 82,7%

Artificial Analysis (Strategy & Ops): Claude Fable 5 $3,48 за run, score 50; DeepSeek V4-Pro $0,03, score 38 — разрыв по cost 116×, score всего ~31% выше. V4-Flash ниже $0,04 за run во всех шести индексах.

Общая позиция: V4-Pro vs GPT-5.6 Sol vs Claude Fable 5
Измерение DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open source / self-hosting MIT, да Closed, нет Closed, нет
Контекстное окно 1M tokens не раскрыто 1M tokens
API output (off-peak) $0,87/M tokens ~$15/M $50/M
Peak output $1,74/M tokens
Agent capability сильная, multi-agent сильная максимальный класс
Конфиденциальность private deployment возможен облако третьей стороны облако третьей стороны

Быстрый выбор: ограниченный budget / высокая частота / private deployment → V4-Pro или V4-Flash; максимум кода, cost вторичен → Claude Fable 5; алгоритмы + math → GPT-5.6 Sol / Ultra; массовые logs / docs → V4-Flash (cache hit input $0,0028/M).

GA впервые вводит дифференцированные peak/off-peak тарифы, как электроэнергия. Peak (пекинское время): в будни 09:00–12:00 и 14:00–18:00, тарифы удваиваются. DeepSeek уведомляет об изменениях за 24 часа по email.

V4-Pro / V4-Flash — полная таблица (off-peak / peak)
Модель Статья Off-peak Peak
V4-Pro Input (cache hit) ¥0,025 / $0,0035 / 1M ×2
V4-Pro Input (cache miss) ¥3,00 / $0,435 / 1M ¥6,00 / $0,87
V4-Pro Output ¥6,00 / $0,87 / 1M ¥12,00 / $1,74
V4-Flash Input (cache hit) ¥0,02 / $0,0028 / 1M ×2
V4-Flash Input (cache miss) ¥1,00 / $0,14 / 1M ¥2,00 / $0,28
V4-Flash Output ¥2,00 / $0,28 / 1M ¥4,00 / $0,56
  • Non-real-time в off-peak: batch документов, labeling, code review после 18:00 или до 09:00.
  • Prompt cache: повторяющиеся system prompts; V4-Flash cache hit $0,0028/M.
  • Flash как router: простые intents → V4-Flash, тяжёлый reasoning → V4-Pro — экономия 60–80%.
  • Email для billing alerts: держать аккаунт на уведомлениях о тарифах.

Даже в peak output V4-Pro ($1,74/M) остаётся в 8,6× дешевле Claude Opus 4.8 ($15/M) и GPT-5.6 Sol (~$15/M).

Важно: deepseek-chat и deepseek-reasoner прекращают работу 24 июля 2026, 15:59 UTC (24 июля 23:59 Пекин).

Таблица миграции
Старая модель Новая модель Примечание
deepseek-chat deepseek-v4-flash (non-think) Быстро, лёгкие задачи
deepseek-reasoner deepseek-v4-flash (think mode) или upgrade на deepseek-v4-pro
  1. Поиск по репозиторию: deepseek-chat и deepseek-reasoner в коде, CI, env vars и secrets.
  2. Модель по сценарию: лёгкие диалоги → deepseek-v4-flash non-think; бывший reasoner → Flash think или deepseek-v4-pro.
  3. OpenAI SDK: менять только model; think mode через extra_body и thinking.
  4. Anthropic-compatible path: base_url остаётся https://api.deepseek.com, modeldeepseek-v4-pro или deepseek-v4-flash.
  5. Staging regression: tool calling, streaming, long context; Think Max требует окно ≥384K.
  6. Prod rollout и monitoring: canary до 24 июля, следить за peak tokens и error rate, включить scheduling при необходимости.
migrate_deepseek_v4.py
model="deepseek-chat"  (недействительно после 24 июля)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

model="deepseek-v4-pro"
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

Официальные источники (перепроверить после release):

https://api.deepseek.com

https://arxiv.org/abs/2606.19348

  • SWE-bench Verified 80,6%: рекорд open-source, паритет с Gemini 3.1 Pro; реальные GitHub bugfixes (публичная сводка, перепроверить).
  • KV cache 10%: при 1M только 10% от V3.2 (Flash 7%), источник arXiv:2606.19348.
  • Cost 116×: Artificial Analysis Strategy & Ops — Fable 5 $3,48 vs V4-Pro $0,03 за run.
  • Снижение в июне: output V4-Pro $0,87/M — исторически сильное соотношение цена/качество (страница тарифов DeepSeek).
  • MIT open source: веса V4-Pro и Flash можно self-host; для данных без выхода в облако.
  • Hard deadline: после 2026-07-24 23:59 Пекин deepseek-chat / deepseek-reasoner недоступны (email API DeepSeek).

DeepSeek V4 GA — один из главных вех open-source LLM в 2026. Ценность не в мгновенном обгоне Claude Fable 5 или GPT-5.6, а в лучшей open-source perf за 1/10–1/100 cost closed-source.

Минусы альтернатив: ① только Claude/GPT cloud — дорогие long-context agents, код через третьих лиц, compliance audit; ② полные веса V4 на 16 GB laptop — невозможно, потерянное время; ③ Mac Studio Ultra на пару недель — простой дороже weekly high-memory rental. Для приватных тестов V4-Flash см. ds4 + деплой Mac 128 GB.

Для команд с требованиями конфиденциальности, ограниченным budget, agent 1M или максимальной API-эффективностью DeepSeek V4 Pro — самый сбалансированный open-source выбор. Воспроизводимая инфраструктура: аренда bare metal Mac Mini NOVAKVM — шесть регионов, dedicated Apple Silicon high memory, гибкость день/неделя/месяц; узел 128 GB для local inference, затем решение о покупке. Завершите миграцию до 24 июля. Страница тарифов, Страница заказа, Центр помощи.