Если вы AI-разработчик или platform lead, который выбирает agent API, batch-pipeline или миграцию провайдера под FinOps-давлением, релиз 31 июля 2026 ломает привычку «сильнее = больше параметров»: V4-Flash-0731 сохраняет 284 млрд total и 13 млрд active, но новый post-training выводит его вперёд preview V4-Pro на девяти agent- и code-бенчмарках — при list price в 36–179× ниже Claude Opus 4.8. Статья покрывает таймлайн апрель–август, таблицы specs, архитектуру CSA+HCA, оговорку Harness, сравнение Kimi K3 / GLM-5.2 / Qwen3.8-Max, kill line рынка, caveats бенчмарков, чек-лист миграции из 6 шагов и FAQ. Перекрёстные ссылки: DeepSeek V4 GA, рейтинг OpenRouter за июль, Kimi K3 open weights. Тарифы: страница цен.
[ SECTION_01 ] // TIMELINE Что реально вышло 31 июля — и какие ловушки были до этого
- 24 апреля 2026: preview V4 с V4-Pro (1,6T / 49B active) и V4-Flash (284B / 13B active), контекст 1M tokens, лицензия MIT.
- 24 июля: legacy-алиасы
deepseek-chatиdeepseek-reasonerотключены окончательно — prod-код без переименования падает. - 27 июля: Moonshot публикует Kimi K3 (2,8T) на Hugging Face — крупнейший open-weight drop недели, прямое давление на DeepSeek.
- 31 июля: V4-Flash-0731 в официальной API beta; та же архитектура, новый post-training; веса на Hugging Face; changelog впервые называет DeepSeek Harness «скоро». Только API — app и web-chat без изменений.
- 2–3 августа: Alibaba Qwen3.8-Max GA; китайская frontier-лига уплотняется.
- На 5 августа: официальный V4-Pro и Harness — «как можно скорее», GA-дата не подтверждена.
Главный вывод: V4-Flash-0731 — не новая модель, а тот же MoE 284B с лучшим post-training. Agent-скоры обходят V4-Pro, но сняты на неопубликованном Harness в minimal mode. Внешней репродукции нет.
Семь болевых точек до обновления:
- Legacy-имена мертвы: после 24 июля
deepseek-chatвозвращает ошибку — fallback отсутствует. - Harness закрыт: Terminal Bench 2.0 (82,7 vs preview V4-Pro 67,9) измерен на unreleased framework — не переносится на Claude Code или Cursor.
- Реальный cache-hit: разработчики сообщают о низком проценте попаданий input cache при тарифе $0,0028/M — счёт может быть выше таблицы.
- Peak pricing анонсирован: DeepSeek обещает ×2 в пиковые часы Пекина (9–12, 14–18) — дата старта не названа.
- Официальный V4-Pro отсутствует: кто ждал GA середины июля, получает только Flash — Pro остаётся preview.
- Смешанный index: Artificial Analysis Intelligence Index (50) ниже Kimi K3 (57) и GLM-5.2 — Flash побеждает по cost, не по абсолютному index.
- Облако и данные: inference обрабатывает промпты на инфраструктуре DeepSeek; команды с персональными данными должны согласовать DPA и субпроцессоров до prod.
[ SECTION_02 ] // SPECS Ключевые данные V4-Flash-0731: параметры, тарифы и сравнение с Claude
| Модель | Статус | Total / active | Input (miss / hit за 1M) | Output за 1M | Лицензия |
|---|---|---|---|---|---|
| DeepSeek V4-Flash-0731 | Официально (31.07.) | 284B / 13B | $0,14 / $0,0028 | $0,28 | MIT |
| DeepSeek V4-Pro | Только preview (24.04.) | 1,6T / 49B | $0,435 / $0,003625 | $0,87 | MIT |
| Claude Opus 4.8 | Closed | Не раскрыто | $5,00 / — | $25,00 | Proprietary |
| Kimi K3 | Веса live (27.07.) | 2,8T / ~104B (оценка) | $3,00 / $0,30 | $15,00 | Modified MIT |
| Qwen3.8-Max | API GA (03.08.), веса pending | 2,4T / 95B | $2,00 / ~$0,17–0,25 | $6,00 | Open обещан |
| GLM-5.2 | Open (июнь 2026) | ~744B / ~40B | Не верифицировано здесь | Не верифицировано | MIT |
Сравнение с Claude (публичные тарифы): input без cache примерно в 36× дешевле Opus 4.8, с cache-hit в 179×, output в 89×. List price против list price — не независимый аудит.
| Benchmark | V4-Flash-0731 | Preview V4-Pro |
|---|---|---|
| Terminal Bench 2.0 | 82,7 | 67,9 |
| SWE-bench Verified | Заявлено выше preview по changelog | 80,6 % (GA-материалы) |
| Девять agent/code suite | Обходит preview V4-Pro | Baseline апреля |
DeepSeek в changelog предупреждает: agent-скоры «крайне чувствительны к выбору harness». Terminal Bench 2.0 снят на unreleased Harness, max reasoning, top_p=0,95, temperature=1,0 — до репродукции сообществом с Claude Code или Cursor это vendor-plus-framework результат.
[ SECTION_03 ] // COMPARE Post-training вместо scale: kill line, Kimi K3, GLM и Qwen в одном окне
Архитектура без изменений — CSA+HCA, mHC, Muon: по technical report «DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence» V4 объединяет Compressed Sparse Attention (CSA) и Heavily Compressed Attention (HCA). На 1M tokens DeepSeek заявляет 27 % inference FLOPs от V3.2 и 10 % KV cache (Flash до 7 %). Цифры вендора без сторонней репродукции — но они объясняют, почему million-token context может стать коммерчески viable, а не остаться marketing spec.
| Модель | Intelligence Index | Cost per task | Интерпретация |
|---|---|---|---|
| DeepSeek V4-Flash-0731 | 50 | $0,03 | Лидер по cost |
| Kimi K3 | 57 | $0,86 | Index выше, ~29× дороже |
| GLM-5.2 | ~+1 к Flash | Не верифицировано | Index чуть выше |
| GPT-5.6 Sol | 9+ к Flash | $1,86 | Closed, ~62× дороже |
| Claude Fable 5 | 9+ к Flash | $3,15 | Closed, ~105× дороже |
Kill line (斩杀线): в китайских dev-форумах термин описывает порог price/performance: без явного преимущества по качеству или цене конкурент теряет relevance. OpenAI снизила GPT-5.6 Luna на 80 % в тот же период — явная ценовая война. Для инженерных команд: Flash — default для volume agents; premium-модели только для hard steps.
Harness — ответ DeepSeek на Claude Code: впервые назван 31 июля. Должен покрывать file I/O, tool calls и multi-step engineering. До релиза большинство использует Claude Code, OpenCode или OpenClaw — там и обрывается переносимость Terminal Bench цифр.
Четыре caveats по бенчмаркам:
- Разделять vendor и third party: Artificial Analysis и SWE-bench Verified ≠ Terminal Bench на unreleased Harness.
- Игнорировать слухи Pro-GA: «10–20 августа» из анонимных источников — DeepSeek говорит только «как можно скорее».
- Usability vs score: низкий cache-hit и timeout safety classifier показывают: post-training не чинит infra alone.
- Funding rumors: сообщения о ~$7,4B раунде и ~$48,7B valuation — пресса без regulatory confirmation.
[ SECTION_04 ] // DEPLOY Шесть шагов: от deepseek-chat к V4-Flash-0731 в production
- Legacy audit: найти в репозитории
deepseek-chat,deepseek-reasonerи старые base URL. Перевести всё наdeepseek-v4-flash— с 24 июля fallback нет. - Проверить model ID и endpoint: OpenAI-compatible client, официальный endpoint по api-docs.deepseek.com. ID
deepseek-v4-flashавтоматически указывает на build 0731. - Настроить cache strategy: кешировать повторяющиеся system prompt и tool schema для $0,0028/M hit. Без cache — $0,14/M input, разница ×50.
- Выбрать reasoning mode: non-think для routing; Think High для debug; Think Max для длинных agent chains 384K+. Рекомендация: temperature=1,0, top_p=1,0.
- Построить tiered routing: daily volume на V4-Flash; hard steps на preview V4-Pro, Claude Opus 5 или GPT-5.6 Sol. См. tiering OpenRouter и цены GPT-5.6.
- Закрепить 24/7 agent runtime: OpenClaw, Claude Code и batch agents требуют persistent macOS node — sleep ноутбука убивает OAuth и длинные runs. Помощь: центр помощи; заказ: страница заказа.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com/v1"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Refactor this agent step."}],
temperature=1.0,
top_p=1.0
)
print(response.choices[0].message.content)
[ SECTION_05 ] // FACTS_FAQ Цитируемые данные, FAQ и 24/7 agent hosting
- Параметры без изменений: 284B total / 13B active; прирост только post-training (changelog 2026-07-31).
- Terminal Bench 2.0: 82,7 (Flash-0731) vs 67,9 (preview V4-Pro) — Harness minimal mode, unreleased.
- Цена vs Claude Opus 4.8: input ~36× / ~179× (cache-hit) / output ~89× дешевле (list price).
- Artificial Analysis: Intelligence Index 50, $0,03 per task — Kimi K3 index 57 при $0,86.
- Объём OpenRouter: preview V4-Flash #1 по tokens семь недель подряд (июль).
- Efficiency на 1M context: 27 % FLOPs и 10 % KV cache vs V3.2 по technical report — vendor claim.
- Peak-off-peak: ×2 в пиковые часы Пекина анонсирован, дата старта открыта.
Краткие FAQ:
- Новая модель? Нет — та же архитектура, новый post-training.
- Flash или Pro? Flash для volume и agent pipelines; preview Pro для deep reasoning до GA.
- Harness доступен? Нет — назван в changelog, публикация pending.
- Self-host 284B? Требует multi-GPU cluster; на Mac Mini realistic path — API inference + bare-metal macOS для harness/runtime.
Публичные источники этой статьи. При изменении upstream сверяйтесь с оригиналами.
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash
Реальные минусы типичных альтернатив (engineering view): cloud-only routing без persistent macOS host рвёт OAuth-сессии и убивает multi-hour agent batch. Self-host 284B weights на 16 GB laptop упирается в RAM и disk — API остаётся realistic inference path, но harness должен работать на стабильном железе. Mac Studio «купил на две недели валидации V4-Flash — три месяца idle» обходится дороже недельной аренды; peak ×2 бьёт 7×24 pipeline без time-window planning.
Для разработчиков и AI automation-команд, которым нужны выделенный Apple Silicon, uptime 24/7 и elastic scaling по дням/неделям/месяцам для V4-Flash API agents (OpenClaw, Claude Code, OpenCode) рядом с iOS CI на том же macOS host, аренда bare-metal Mac Mini NOVAKVM — обычно лучший fit: шесть регионов, high-memory tiers и прямой SSH отделяют cloud flagship inference от стабильного macOS execution — без sleep ноутбука и без peak-сюрпризов без scheduling discipline. Сравните M4 Pro и storage tiers на странице тарифов NOVAKVM, запустите trial на странице заказа, remote setup — в центре помощи.