После трёх месяцев ожидания DeepSeek V4 в полной версии (GA) официально вышел 20 июля 2026. По сравнению с preview апреля GA улучшает агентов, математический reasoning и генерацию кода и впервые вводит дифференцированные peak/off-peak тарифы — DeepSeek переходит от «почти бесплатно» к дисциплинированной коммерциализации. Статья для команд на deepseek-chat с обязательной миграцией до 24 июля и для тех, кто выбирает между GPT-5.6, Claude Fable 5 и V4: сначала семь болевых точек, затем хронология, архитектура MoE 1,6T (CSA+HCA, mHC, Muon), бенчмарки, тройное сравнение, таблица peak-цен, чеклист миграции из шести шагов и цитируемые параметры, завершение — self-hosting на Mac и узлы NOVAKVM с большой памятью. Данные: документация DeepSeek и arXiv:2606.19348; ссылки перепроверить после релиза. Цены: страница тарифов, заказ: страница заказа; см. также гайд ds4 local и релиз GPT-5.6.
[ SECTION_01 ] // PAIN_MAP Семь болевых точек перед GA DeepSeek V4
- Legacy API отключается:
deepseek-chatиdeepseek-reasonerнавсегда прекращают работу 24 июля 2026, 23:59 (пекинское время). Прод без смены модели получит жёсткий обрыв. - Peak/off-peak усложняет планирование: в будни 09:00–12:00 и 14:00–18:00 (Пекин) тарифы удваиваются; agent-pipeline 7×24 без временных окон может раздуть счёт.
- Pro vs Flash неочевиден: V4-Pro (1,6T / 49B active) и V4-Flash (284B / 13B active) различаются по цене и возможностям; неверный роутинг тратит токены или качество.
- Closed-source флагманы впереди: Claude Fable 5 — 80,3% на SWE-bench Pro, V4-Pro — 55,4%; «лучший open-source» ≠ «лучшая модель вообще».
- 1M контекста не бесплатен: KV cache снижен до 10% от V3.2, но длинные agent-контексты всё равно едят RAM и compute; self-hosting от 96 GB+ unified memory (путь ds4).
- Давление compliance: финансы, медицина, госсектор предпочитают MIT + private deployment; полные веса V4-Pro локально дороги по железу.
- Три режима inference: Non-think / Think High / Think Max плюс рекомендованные
temperature=1.0, top_p=1.0требуют настройки по сценарию; слепой Think Max повышает latency и cost.
[ SECTION_02 ] // ARCHITECTURE От preview к GA: хронология и архитектура V4-Pro / Flash
| Дата | Событие |
|---|---|
| 24 апреля | Preview V4 online и open source (MIT): V4-Pro (1,6T) и V4-Flash (284B) |
| Май | Production tuning, API официально доступен |
| Июнь | Цена output V4-Pro −75% навсегда до $0,87/M tokens |
| 29 июня | Email: GA в середине июля, первое объявление peak/off-peak |
| 19 июля | Grey GA для части разработчиков, пресса: «полная версия завтра» |
| 20 июля | GA полная версия online (дата публикации) |
| 24 июля | deepseek-chat / deepseek-reasoner offline навсегда |
Кратко: GA улучшает agent, math reasoning и code vs preview и вводит peak/off-peak billing; базовая MoE-архитектура без изменений.
| Параметр | V4-Pro | V4-Flash |
|---|---|---|
| Всего параметров | 1,6 трлн (1,6T) | 284 млрд (284B) |
| Active на token | 49 млрд (49B) | 13 млрд (13B) |
| Слои Transformer | 61 | 43 |
| Контекстное окно | 1 000 000 tokens | 1 000 000 tokens |
| Max output | 384K tokens | 384K tokens |
| Точность | FP4 (experts) + FP8 (остальное) | FP4 + FP8 mixed |
| Pretraining data | 33T+ tokens | 32T+ tokens |
| Лицензия | MIT | MIT |
Ключевые инновации (контекст 1M):
- Hybrid attention (CSA + HCA): вместо MLA V2/V3: Compressed Sparse Attention (CSA — KV сжат 4× через Softmax gating, FP4 Lightning Indexer top-k, Pro top-1024 / Flash top-512, sliding window 128 tokens) и Heavy Compressed Attention (HCA — сжатие 128×, затем dense global attention) чередуются. При 1M: 27% FLOPs V3.2, KV cache 10% (Flash 7%).
- Manifold-Constrained Hyper-Connections (mHC): 4-канальный residual stream + doubly stochastic matrix (Birkhoff polytope) для стабильных градиентов на 61 слое.
- Muon optimizer: Newton-Schulz ортогонализация градиентов при обучении — быстрее и стабильнее AdamW.
| Режим | Особенность | Применение |
|---|---|---|
| Non-think | Без chain-of-thought, максимальная скорость | Простые Q&A, routing |
| Think High | Явный reasoning (CoT tags) | Средняя сложность, debug кода |
| Think Max | Максимальный reasoning, контекст 384K+ | Сложная математика, длинные agent-цепочки |
Официальные sampling defaults (все режимы):
temperature=1.0,top_p=1.0.
[ SECTION_03 ] // BENCHMARK Бенчмарки и матрица vs GPT-5.6 / Claude Fable 5
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6% (рекорд open-source) | 96,0% | не опубликован отдельно | ~69% |
| SWE-bench Pro | 55,4% | 80,3% | 78,1% | 69,2% |
| LiveCodeBench (Pass@1) | 93,5% | 88,1% | 87,4% | 83,2% |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9% | 88,0% | 85,1% | 82,7% |
Artificial Analysis (Strategy & Ops): Claude Fable 5 $3,48 за run, score 50; DeepSeek V4-Pro $0,03, score 38 — разрыв по cost 116×, score всего ~31% выше. V4-Flash ниже $0,04 за run во всех шести индексах.
| Измерение | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source / self-hosting | MIT, да | Closed, нет | Closed, нет |
| Контекстное окно | 1M tokens | не раскрыто | 1M tokens |
| API output (off-peak) | $0,87/M tokens | ~$15/M | $50/M |
| Peak output | $1,74/M tokens | — | — |
| Agent capability | сильная, multi-agent | сильная | максимальный класс |
| Конфиденциальность | private deployment возможен | облако третьей стороны | облако третьей стороны |
Быстрый выбор: ограниченный budget / высокая частота / private deployment → V4-Pro или V4-Flash; максимум кода, cost вторичен → Claude Fable 5; алгоритмы + math → GPT-5.6 Sol / Ultra; массовые logs / docs → V4-Flash (cache hit input $0,0028/M).
[ SECTION_04 ] // PRICING Peak/off-peak: окна, полная таблица и четыре способа экономии
GA впервые вводит дифференцированные peak/off-peak тарифы, как электроэнергия. Peak (пекинское время): в будни 09:00–12:00 и 14:00–18:00, тарифы удваиваются. DeepSeek уведомляет об изменениях за 24 часа по email.
| Модель | Статья | Off-peak | Peak |
|---|---|---|---|
| V4-Pro | Input (cache hit) | ¥0,025 / $0,0035 / 1M | ×2 |
| V4-Pro | Input (cache miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 |
| V4-Pro | Output | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 |
| V4-Flash | Input (cache hit) | ¥0,02 / $0,0028 / 1M | ×2 |
| V4-Flash | Input (cache miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 |
| V4-Flash | Output | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 |
- Non-real-time в off-peak: batch документов, labeling, code review после 18:00 или до 09:00.
- Prompt cache: повторяющиеся system prompts; V4-Flash cache hit $0,0028/M.
- Flash как router: простые intents → V4-Flash, тяжёлый reasoning → V4-Pro — экономия 60–80%.
- Email для billing alerts: держать аккаунт на уведомлениях о тарифах.
Даже в peak output V4-Pro ($1,74/M) остаётся в 8,6× дешевле Claude Opus 4.8 ($15/M) и GPT-5.6 Sol (~$15/M).
[ SECTION_05 ] // MIGRATION Миграция API: чеклист из шести шагов (deadline 24 июля 23:59)
Важно: deepseek-chat и deepseek-reasoner прекращают работу 24 июля 2026, 15:59 UTC (24 июля 23:59 Пекин).
| Старая модель | Новая модель | Примечание |
|---|---|---|
deepseek-chat |
deepseek-v4-flash (non-think) |
Быстро, лёгкие задачи |
deepseek-reasoner |
deepseek-v4-flash (think mode) |
или upgrade на deepseek-v4-pro |
- Поиск по репозиторию:
deepseek-chatиdeepseek-reasonerв коде, CI, env vars и secrets. - Модель по сценарию: лёгкие диалоги →
deepseek-v4-flashnon-think; бывший reasoner → Flash think илиdeepseek-v4-pro. - OpenAI SDK: менять только
model; think mode черезextra_bodyиthinking. - Anthropic-compatible path:
base_urlостаётсяhttps://api.deepseek.com,model→deepseek-v4-proилиdeepseek-v4-flash. - Staging regression: tool calling, streaming, long context; Think Max требует окно ≥384K.
- Prod rollout и monitoring: canary до 24 июля, следить за peak tokens и error rate, включить scheduling при необходимости.
model="deepseek-chat" (недействительно после 24 июля)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
model="deepseek-v4-pro"
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
Официальные источники (перепроверить после release):
https://arxiv.org/abs/2606.19348
[ SECTION_06 ] // FACTS Цитируемые факты и self-hosting на Mac
- SWE-bench Verified 80,6%: рекорд open-source, паритет с Gemini 3.1 Pro; реальные GitHub bugfixes (публичная сводка, перепроверить).
- KV cache 10%: при 1M только 10% от V3.2 (Flash 7%), источник arXiv:2606.19348.
- Cost 116×: Artificial Analysis Strategy & Ops — Fable 5 $3,48 vs V4-Pro $0,03 за run.
- Снижение в июне: output V4-Pro $0,87/M — исторически сильное соотношение цена/качество (страница тарифов DeepSeek).
- MIT open source: веса V4-Pro и Flash можно self-host; для данных без выхода в облако.
- Hard deadline: после 2026-07-24 23:59 Пекин
deepseek-chat/deepseek-reasonerнедоступны (email API DeepSeek).
DeepSeek V4 GA — один из главных вех open-source LLM в 2026. Ценность не в мгновенном обгоне Claude Fable 5 или GPT-5.6, а в лучшей open-source perf за 1/10–1/100 cost closed-source.
Минусы альтернатив: ① только Claude/GPT cloud — дорогие long-context agents, код через третьих лиц, compliance audit; ② полные веса V4 на 16 GB laptop — невозможно, потерянное время; ③ Mac Studio Ultra на пару недель — простой дороже weekly high-memory rental. Для приватных тестов V4-Flash см. ds4 + деплой Mac 128 GB.
Для команд с требованиями конфиденциальности, ограниченным budget, agent 1M или максимальной API-эффективностью DeepSeek V4 Pro — самый сбалансированный open-source выбор. Воспроизводимая инфраструктура: аренда bare metal Mac Mini NOVAKVM — шесть регионов, dedicated Apple Silicon high memory, гибкость день/неделя/месяц; узел 128 GB для local inference, затем решение о покупке. Завершите миграцию до 24 июля. Страница тарифов, Страница заказа, Центр помощи.