DeepSeek V4-Flash-0731 официально:
agent-бенчмарки обходят V4-Pro, цены ниже Claude

Если вы AI-разработчик или platform lead, который выбирает agent API, batch-pipeline или миграцию провайдера под FinOps-давлением, релиз 31 июля 2026 ломает привычку «сильнее = больше параметров»: V4-Flash-0731 сохраняет 284 млрд total и 13 млрд active, но новый post-training выводит его вперёд preview V4-Pro на девяти agent- и code-бенчмарках — при list price в 36–179× ниже Claude Opus 4.8. Статья покрывает таймлайн апрель–август, таблицы specs, архитектуру CSA+HCA, оговорку Harness, сравнение Kimi K3 / GLM-5.2 / Qwen3.8-Max, kill line рынка, caveats бенчмарков, чек-лист миграции из 6 шагов и FAQ. Перекрёстные ссылки: DeepSeek V4 GA, рейтинг OpenRouter за июль, Kimi K3 open weights. Тарифы: страница цен.

  • 24 апреля 2026: preview V4 с V4-Pro (1,6T / 49B active) и V4-Flash (284B / 13B active), контекст 1M tokens, лицензия MIT.
  • 24 июля: legacy-алиасы deepseek-chat и deepseek-reasoner отключены окончательно — prod-код без переименования падает.
  • 27 июля: Moonshot публикует Kimi K3 (2,8T) на Hugging Face — крупнейший open-weight drop недели, прямое давление на DeepSeek.
  • 31 июля: V4-Flash-0731 в официальной API beta; та же архитектура, новый post-training; веса на Hugging Face; changelog впервые называет DeepSeek Harness «скоро». Только API — app и web-chat без изменений.
  • 2–3 августа: Alibaba Qwen3.8-Max GA; китайская frontier-лига уплотняется.
  • На 5 августа: официальный V4-Pro и Harness — «как можно скорее», GA-дата не подтверждена.

Главный вывод: V4-Flash-0731 — не новая модель, а тот же MoE 284B с лучшим post-training. Agent-скоры обходят V4-Pro, но сняты на неопубликованном Harness в minimal mode. Внешней репродукции нет.

Семь болевых точек до обновления:

  • Legacy-имена мертвы: после 24 июля deepseek-chat возвращает ошибку — fallback отсутствует.
  • Harness закрыт: Terminal Bench 2.0 (82,7 vs preview V4-Pro 67,9) измерен на unreleased framework — не переносится на Claude Code или Cursor.
  • Реальный cache-hit: разработчики сообщают о низком проценте попаданий input cache при тарифе $0,0028/M — счёт может быть выше таблицы.
  • Peak pricing анонсирован: DeepSeek обещает ×2 в пиковые часы Пекина (9–12, 14–18) — дата старта не названа.
  • Официальный V4-Pro отсутствует: кто ждал GA середины июля, получает только Flash — Pro остаётся preview.
  • Смешанный index: Artificial Analysis Intelligence Index (50) ниже Kimi K3 (57) и GLM-5.2 — Flash побеждает по cost, не по абсолютному index.
  • Облако и данные: inference обрабатывает промпты на инфраструктуре DeepSeek; команды с персональными данными должны согласовать DPA и субпроцессоров до prod.

Сравнение flagship-моделей (данные вендора, на 2026-08-05)
Модель Статус Total / active Input (miss / hit за 1M) Output за 1M Лицензия
DeepSeek V4-Flash-0731 Официально (31.07.) 284B / 13B $0,14 / $0,0028 $0,28 MIT
DeepSeek V4-Pro Только preview (24.04.) 1,6T / 49B $0,435 / $0,003625 $0,87 MIT
Claude Opus 4.8 Closed Не раскрыто $5,00 / — $25,00 Proprietary
Kimi K3 Веса live (27.07.) 2,8T / ~104B (оценка) $3,00 / $0,30 $15,00 Modified MIT
Qwen3.8-Max API GA (03.08.), веса pending 2,4T / 95B $2,00 / ~$0,17–0,25 $6,00 Open обещан
GLM-5.2 Open (июнь 2026) ~744B / ~40B Не верифицировано здесь Не верифицировано MIT

Сравнение с Claude (публичные тарифы): input без cache примерно в 36× дешевле Opus 4.8, с cache-hit в 179×, output в 89×. List price против list price — не независимый аудит.

Agent-бенчмарки V4-Flash-0731 vs preview V4-Pro (changelog DeepSeek, Harness minimal mode)
Benchmark V4-Flash-0731 Preview V4-Pro
Terminal Bench 2.082,767,9
SWE-bench VerifiedЗаявлено выше preview по changelog80,6 % (GA-материалы)
Девять agent/code suiteОбходит preview V4-ProBaseline апреля

DeepSeek в changelog предупреждает: agent-скоры «крайне чувствительны к выбору harness». Terminal Bench 2.0 снят на unreleased Harness, max reasoning, top_p=0,95, temperature=1,0 — до репродукции сообществом с Claude Code или Cursor это vendor-plus-framework результат.

Архитектура без изменений — CSA+HCA, mHC, Muon: по technical report «DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence» V4 объединяет Compressed Sparse Attention (CSA) и Heavily Compressed Attention (HCA). На 1M tokens DeepSeek заявляет 27 % inference FLOPs от V3.2 и 10 % KV cache (Flash до 7 %). Цифры вендора без сторонней репродукции — но они объясняют, почему million-token context может стать коммерчески viable, а не остаться marketing spec.

Artificial Analysis Intelligence Index и cost per task (third party, через финмедиа)
Модель Intelligence Index Cost per task Интерпретация
DeepSeek V4-Flash-073150$0,03Лидер по cost
Kimi K357$0,86Index выше, ~29× дороже
GLM-5.2~+1 к FlashНе верифицированоIndex чуть выше
GPT-5.6 Sol9+ к Flash$1,86Closed, ~62× дороже
Claude Fable 59+ к Flash$3,15Closed, ~105× дороже

Kill line (斩杀线): в китайских dev-форумах термин описывает порог price/performance: без явного преимущества по качеству или цене конкурент теряет relevance. OpenAI снизила GPT-5.6 Luna на 80 % в тот же период — явная ценовая война. Для инженерных команд: Flash — default для volume agents; premium-модели только для hard steps.

Harness — ответ DeepSeek на Claude Code: впервые назван 31 июля. Должен покрывать file I/O, tool calls и multi-step engineering. До релиза большинство использует Claude Code, OpenCode или OpenClaw — там и обрывается переносимость Terminal Bench цифр.

Четыре caveats по бенчмаркам:

  1. Разделять vendor и third party: Artificial Analysis и SWE-bench Verified ≠ Terminal Bench на unreleased Harness.
  2. Игнорировать слухи Pro-GA: «10–20 августа» из анонимных источников — DeepSeek говорит только «как можно скорее».
  3. Usability vs score: низкий cache-hit и timeout safety classifier показывают: post-training не чинит infra alone.
  4. Funding rumors: сообщения о ~$7,4B раунде и ~$48,7B valuation — пресса без regulatory confirmation.

  1. Legacy audit: найти в репозитории deepseek-chat, deepseek-reasoner и старые base URL. Перевести всё на deepseek-v4-flash — с 24 июля fallback нет.
  2. Проверить model ID и endpoint: OpenAI-compatible client, официальный endpoint по api-docs.deepseek.com. ID deepseek-v4-flash автоматически указывает на build 0731.
  3. Настроить cache strategy: кешировать повторяющиеся system prompt и tool schema для $0,0028/M hit. Без cache — $0,14/M input, разница ×50.
  4. Выбрать reasoning mode: non-think для routing; Think High для debug; Think Max для длинных agent chains 384K+. Рекомендация: temperature=1,0, top_p=1,0.
  5. Построить tiered routing: daily volume на V4-Flash; hard steps на preview V4-Pro, Claude Opus 5 или GPT-5.6 Sol. См. tiering OpenRouter и цены GPT-5.6.
  6. Закрепить 24/7 agent runtime: OpenClaw, Claude Code и batch agents требуют persistent macOS node — sleep ноутбука убивает OAuth и длинные runs. Помощь: центр помощи; заказ: страница заказа.
deepseek-v4-flash-api.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com/v1"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Refactor this agent step."}],
    temperature=1.0,
    top_p=1.0
)
print(response.choices[0].message.content)

  • Параметры без изменений: 284B total / 13B active; прирост только post-training (changelog 2026-07-31).
  • Terminal Bench 2.0: 82,7 (Flash-0731) vs 67,9 (preview V4-Pro) — Harness minimal mode, unreleased.
  • Цена vs Claude Opus 4.8: input ~36× / ~179× (cache-hit) / output ~89× дешевле (list price).
  • Artificial Analysis: Intelligence Index 50, $0,03 per task — Kimi K3 index 57 при $0,86.
  • Объём OpenRouter: preview V4-Flash #1 по tokens семь недель подряд (июль).
  • Efficiency на 1M context: 27 % FLOPs и 10 % KV cache vs V3.2 по technical report — vendor claim.
  • Peak-off-peak: ×2 в пиковые часы Пекина анонсирован, дата старта открыта.

Краткие FAQ:

  • Новая модель? Нет — та же архитектура, новый post-training.
  • Flash или Pro? Flash для volume и agent pipelines; preview Pro для deep reasoning до GA.
  • Harness доступен? Нет — назван в changelog, публикация pending.
  • Self-host 284B? Требует multi-GPU cluster; на Mac Mini realistic path — API inference + bare-metal macOS для harness/runtime.

Публичные источники этой статьи. При изменении upstream сверяйтесь с оригиналами.

https://api-docs.deepseek.com

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash

https://artificialanalysis.ai

Реальные минусы типичных альтернатив (engineering view): cloud-only routing без persistent macOS host рвёт OAuth-сессии и убивает multi-hour agent batch. Self-host 284B weights на 16 GB laptop упирается в RAM и disk — API остаётся realistic inference path, но harness должен работать на стабильном железе. Mac Studio «купил на две недели валидации V4-Flash — три месяца idle» обходится дороже недельной аренды; peak ×2 бьёт 7×24 pipeline без time-window planning.

Для разработчиков и AI automation-команд, которым нужны выделенный Apple Silicon, uptime 24/7 и elastic scaling по дням/неделям/месяцам для V4-Flash API agents (OpenClaw, Claude Code, OpenCode) рядом с iOS CI на том же macOS host, аренда bare-metal Mac Mini NOVAKVM — обычно лучший fit: шесть регионов, high-memory tiers и прямой SSH отделяют cloud flagship inference от стабильного macOS execution — без sleep ноутбука и без peak-сюрпризов без scheduling discipline. Сравните M4 Pro и storage tiers на странице тарифов NOVAKVM, запустите trial на странице заказа, remote setup — в центре помощи.