DeepSeek V4-Flash-0731 正式版:
Agent ベンチで V4-Pro 超え、Opus 4.8 の 1/100 コスト

Agent API コスト最適化、deepseek-chat からの移行、国産 open weight 大規模モデル選定を検討する AI 開発者と技術責任者にとって、7 月 31 日 DeepSeek が API 公測したV4-Flash-0731 正式版は、「パラメータを積まずに Agent 能力を引き上げる」路線の実証です。284B 総量・13B 活性のアーキテクチャは 4 月プレビューと同一で、性能向上は後訓練の再実行のみに由来します。Agent ベンチでは 1.6T の V4-Pro プレビュー版を上回り、Claude Opus 4.8 比で入力キャッシュミス約 36 倍・キャッシュヒット約 179 倍・出力約 89 倍の価格差が報じられています。本稿では三か月のタイムライン、コアスペック表、Harness フレームワーク、Kimi K3 / GLM-5.2 / Qwen3.8-Max 横断比較、Artificial Analysis 指数 50・単タスク $0.03、ベンチマーク論争、六ステップ API 移行、V4-Pro 未リリースの現状を整理します。V4 GA 編Kimi K3 編Qwen3.8-Max 編と併読してください。料金は 料金ページをご覧ください。

  • 4 月 24 日:V4 プレビュー公開・MIT オープンソース。V4-Pro(1.6T / 49B 活性)と V4-Flash(284B / 13B 活性)、いずれも 100 万 token コンテキスト。
  • 7 月 24 日:deepseek-chat / deepseek-reasoner 永久停止。全トラフィックが V4 系列命名へ移行。
  • 7 月 27 日:Moonshot AI が Kimi K3(2.8T)重みを Hugging Face に公開。DeepSeek に競争圧力。
  • 7 月 31 日:V4-Flash-0731 正式版が API 公測開始。同一アーキ・同一パラメータで後訓練のみ刷新。Hugging Face に MIT 重み同期。changelog で自社 Agent フレームワーク Harness を初公開(「近日リリース」)。API のみ更新、App・Web は未同期。
  • 8 月 3 日:Alibaba Qwen3.8-Max が GA。国産 flagship 三強(DeepSeek / Kimi / Qwen)が同週に更新。
  • 8 月 5 日(執筆時点):V4-Pro 正式版は「できるだけ早く」のみ。8 月 10–20 日 GA は未署名メディア由来で公式未確認

結論:V4-Flash-0731 は「新モデル」ではなく同一 284B/13B の後訓練アップデートです。Agent ベンチマークで V4-Pro プレビューを上回る一方、測定は未公開 Harness に依存し、V4-Pro 正式版と Harness 本体は未リリースです。

開発者が直面する痛点:

  • Pro 期待値のすれ:7 月中旬 V4-Pro 全量 GA の期待がずれ、中国 AI コミュニティでは創業者梁文鋒への評価が「空約束」から「期待以上」へ反転しましたが、Pro 正式版は依然未届です。
  • Harness 依存のベンチマーク:Terminal Bench 2.0(82.7 点 vs V4-Pro プレビュー 67.9 点)等は Harness ミニマルモード・max 設定・top_p=0.95・temperature=1.0 で測定。公式も「harness 選択に極端に敏感」と警告しています。
  • 実利用の報告:海外開発者コミュニティでは入力キャッシュヒット率の低さ、安全分類器のタイムアウト等が報告され、ベンチマークと実運用のギャップが指摘されています。
  • キルライン圧力:「十分な性能+極端な低価格」の組み合わせが同業の価格戦略を逼迫。GPT-5.6 Luna 80% 値下げ等の背景要因の一つです。

DeepSeek V4-Flash-0731 コアパラメータ(出典:DeepSeek 公式 changelog・API ドキュメント、2026-07-31)
項目
リリース日2026 年 7 月 31 日(API 正式版公測)
ビルドタグV4-Flash-0731
総パラメータ / 活性パラメータ284B / 13B(4 月プレビューと同一)
性能向上の源泉アーキ変更なし、後訓練の再実行のみ
コンテキストウィンドウ100 万 token
API 入力(キャッシュミス / ヒット)$0.14 / $0.0028(百万 token あたり)
API 出力$0.28(百万 token あたり)
ライセンスMIT(Hugging Face 重み公開済み)
Terminal Bench 2.0(DeepSeek 自測・Harness)82.7(V4-Pro プレビュー 67.9 を上回る)
Artificial Analysis Intelligence Index50(第三者独立評価)
Artificial Analysis 単タスク平均コスト$0.03
V4-Pro 正式版未リリース(プレビュー版のみ)

アーキテクチャ(4 月から変更なし):ハイブリッドアテンション CSA+HCA(DSA スパースアテンション)、流形制約ハイパーコネクション mHC、Muon 最適化器。100 万 token 推論時、V4-Pro は V3.2 比 FLOPs 27%、KV Cache 10%(DeepSeek 技術報告 arXiv:2606.19348、ベンダー自報)。後訓練のみの改善で 284B/13B が 1.6T/49B の V4-Pro プレビューを Agent ベンチで上回った点は、2026 年後半の「規模競争から効率・データ品質競争へ」の象徴です。

DeepSeek Harness とは:7 月 31 日 changelog で初公開された自社 Agent 実行フレームワークです。ファイル読み書き、ツール呼び出し、コマンド実行、エンドツーエンド工程タスクを担い、Claude Code 相当として位置づけられます。これまで DeepSeek モデルは Claude Code や OpenCode 等の第三者 Agent に依存してきました。V4-Flash-0731 の Agent ベンチマークはすべて Harness ミニマルモードで測定され、Harness 本体は執筆時点未公開です。

flagship 大規模モデル横断比較(2026 年 8 月初時点)
モデル 総/活性パラメータ Artificial Analysis 指数 単タスク平均コスト 出力 API(百万 token)
V4-Flash-0731 284B / 13B 50 $0.03 $0.28
Kimi K3 2.8T / 約 500 億 57 $0.86 $15
GLM-5.2 約 744B / 約 40B V4-Flash 比約 +1 本稿未確認 本稿未確認
Qwen3.8-Max 2.4T / 950 億 本稿未確認 本稿未確認 $6
GPT-5.6 Sol 非公開 V4-Flash 比約 +9 $1.86 約 $15
Claude Opus 4.8 非公開 上位 $15

Artificial Analysis 指数と DeepSeek 自社 Agent ベンチマークは評価手法が異なり、直接加算比較できません。第三者指数では V4-Flash は Kimi K3・GLM-5.2 に若干劣る一方、単タスクコストは Kimi K3 の約 1/29、GPT-5.6 Sol の約 1/62、Claude Fable 5 の約 1/105 です。DeepSeek の狙いは「ベンチマーク第一」ではなく「十分な知能+誰も真似できない価格」—— OpenRouter でプレビュー版が 7 週連続呼び出し量首位だった背景と一致します。

ベンチマークを過信しない四つの理由:

  1. Harness 未公開:Agent ベンチマークは未リリース Harness ミニマルモード依存。Claude Code・Cursor での独立再現待ちです。
  2. 公式自身の警告:changelog に「ベンチマークは harness 選択に極端に敏感」と明記されています。
  3. 実運用報告:キャッシュヒット率低下、安全分類器タイムアウト等、ベンチマークと乖離するフィードバックがあります。
  4. V4-Pro GA 日付の噂:8 月 10–20 日等は未署名メディア由来。公式は「できるだけ早く」のみです。

  1. レガシー model 名を全リポジトリで検索:deepseek-chat / deepseek-reasoner は 7 月 24 日停止済みです。CI・環境変数・Secret をスキャンしてください。
  2. workload 別に V4 命名を選定:軽量チャット・大量バッチ → deepseek-v4-flash 非 think。旧 reasoner 相当 → Flash think モードまたは deepseek-v4-pro プレビュー。
  3. SDK 設定を更新:base_urlhttps://api.deepseek.com 据え置き。OpenAI / Anthropic 互換 SDK は model のみ変更。think モードは extra_body で設定します。
  4. ピーク・オフピーク料金をスケジュール:平日 09:00–12:00、14:00–18:00(北京時間)は 2 倍予告済み。24 時間 Agent はオフピークへシフト検討。OpenRouter 7 月階層選定も参照してください。
  5. 階層ルーティングを構築:日常 Agentic Coding は V4-Flash-0731 で処理し、難所は Claude Opus 4.8 や GPT-5.6 Sol にエスカレート。GPT-5.6 値下げ編と併読してください。
  6. 7×24 Agent 実行環境を固定:長時間 Harness 待ちの Agent オーケストレーションは、スリープするノート PC ではなく常時稼働 macOS ノードが必要です。ヘルプセンター注文ページをご覧ください。
deepseek-v4-flash-api.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Review this Python module for security issues."}]
)
print(response.choices[0].message.content)

  • パラメータ不変・後訓練のみ:284B / 13B。性能向上は post-training 再実行(出典:DeepSeek 7/31 changelog)。
  • Terminal Bench 2.0:82.7 点、V4-Pro プレビュー 67.9 点超え(Harness ミニマルモード・DeepSeek 自測)。
  • Artificial Analysis:Intelligence Index 50、単タスク $0.03(第三者独立評価)。
  • Opus 4.8 価格差:入力キャッシュミス約 36 倍、キャッシュヒット約 179 倍、出力約 89 倍安(出典:21 世紀経済報道等、ベンダー公示価格ベース)。
  • 1M コンテキスト効率:V4-Pro は V3.2 比 FLOPs 27%、KV Cache 10%(出典:arXiv:2606.19348)。
  • API のみ更新:7/31 時点で App・Web チャットは旧版のまま(出典:DeepSeek changelog)。
  • V4-Pro / Harness:「できるだけ早く」リリース予定、具体日未公表。

業界背景:7 月 31 日 V4-Flash-0731 公測当日、Nvidia・Broadcom・AMD 等の算力株に大きな変動はありませんでした。2025 年初の DeepSeek-R1 時の AI チップ株急落と対照的で、市場は「より少ない算力で同等効果」を通常の工程革新として受け止め始めています。同週 Kimi K3 重み公開、8 月 Qwen3.8-Max GA と重なり、国産 open weight 三強の価格・Agent 能力競争が加速しています。

FAQ 抜粋:

  • Q:V4-Flash-0731 は V4-Pro より強いですか?A:Agent ベンチでは Harness 測定で上回りますが、 harness 依存です。複雑推論では Pro プレビューが有利な場面もあります。
  • Q:V4-Pro 正式版はいつですか?A:未確認。8 月 10–20 日は噂レベルです。
  • Q:ベンチマークは信頼できますか?A:SWE-bench Verified 等は参考になります。Terminal Bench 2.0 等は Harness 依存で独立再現待ちです。
  • Q:deepseek-chat 移行は?A:7/24 停止済み。deepseek-v4-flash へ更新してください。
  • Q:Harness とは?A:DeepSeek 初の自社 Agent フレームワーク。7/31 初公開、本体は未リリース。

以下は執筆時点の公開ソースです。上流が更新された場合は原文を正としてください。

https://api-docs.deepseek.com

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash

https://arxiv.org/abs/2606.19348

代替構成の実務上の欠点:① 16GB ノート PC で 284B 重みのローカル推論を試すと、ds4 でも 96GB 以上の統一メモリが実質要件で、API fallback ではハード上限を超えられません。② 蓋を閉じるとスリープし OAuth が切れ、7 週連続 OpenRouter 首位級の Agent バッチが中断します。③ V4-Flash Agent 検証のために高配 Mac Studio を買い、3 か月放置すると週次レンタルの数倍の減価償却が発生します。284B 級推論は API 経由が正しく、ローカルに必要なのは安定した macOS Agent オーケストレーション面だけです。ds4 ローカル推論編を参照してください。

専有 Apple Silicon、7×24 常時稼働、日/週/月の弾力スケールで、macOS ホスト上に V4-Flash API 駆動の Agent(Claude Code、OpenClaw、OpenCode 等)と iOS CI を同居させたい開発者と AI 自動化チームには、NOVAKVM の Mac Mini クラウドベアメタルレンタルが通常はより適した選択です。六地域ノード、高メモリ構成、SSH 直結で、DeepSeek API 推論と裸金属 macOS 実行面を分離し、多ノードクラスタ自前構築とノート PC スリープの二重の罠を避けられます。NOVAKVM 料金ページで M4 Pro とストレージ拡張を比較し、注文ページで試験機を起動してください。リモート接続は ヘルプセンターをご参照ください。