Agent API コスト最適化、deepseek-chat からの移行、国産 open weight 大規模モデル選定を検討する AI 開発者と技術責任者にとって、7 月 31 日 DeepSeek が API 公測したV4-Flash-0731 正式版は、「パラメータを積まずに Agent 能力を引き上げる」路線の実証です。284B 総量・13B 活性のアーキテクチャは 4 月プレビューと同一で、性能向上は後訓練の再実行のみに由来します。Agent ベンチでは 1.6T の V4-Pro プレビュー版を上回り、Claude Opus 4.8 比で入力キャッシュミス約 36 倍・キャッシュヒット約 179 倍・出力約 89 倍の価格差が報じられています。本稿では三か月のタイムライン、コアスペック表、Harness フレームワーク、Kimi K3 / GLM-5.2 / Qwen3.8-Max 横断比較、Artificial Analysis 指数 50・単タスク $0.03、ベンチマーク論争、六ステップ API 移行、V4-Pro 未リリースの現状を整理します。V4 GA 編、Kimi K3 編、Qwen3.8-Max 編と併読してください。料金は 料金ページをご覧ください。
[ SECTION_01 ] // TIMELINE 4 月プレビューから 7 月正式版まで:V4-Pro 未届と Agent ベンチマークの痛点
- 4 月 24 日:V4 プレビュー公開・MIT オープンソース。V4-Pro(1.6T / 49B 活性)と V4-Flash(284B / 13B 活性)、いずれも 100 万 token コンテキスト。
- 7 月 24 日:
deepseek-chat/deepseek-reasoner永久停止。全トラフィックが V4 系列命名へ移行。 - 7 月 27 日:Moonshot AI が Kimi K3(2.8T)重みを Hugging Face に公開。DeepSeek に競争圧力。
- 7 月 31 日:V4-Flash-0731 正式版が API 公測開始。同一アーキ・同一パラメータで後訓練のみ刷新。Hugging Face に MIT 重み同期。changelog で自社 Agent フレームワーク Harness を初公開(「近日リリース」)。API のみ更新、App・Web は未同期。
- 8 月 3 日:Alibaba Qwen3.8-Max が GA。国産 flagship 三強(DeepSeek / Kimi / Qwen)が同週に更新。
- 8 月 5 日(執筆時点):V4-Pro 正式版は「できるだけ早く」のみ。8 月 10–20 日 GA は未署名メディア由来で公式未確認。
結論:V4-Flash-0731 は「新モデル」ではなく同一 284B/13B の後訓練アップデートです。Agent ベンチマークで V4-Pro プレビューを上回る一方、測定は未公開 Harness に依存し、V4-Pro 正式版と Harness 本体は未リリースです。
開発者が直面する痛点:
- Pro 期待値のすれ:7 月中旬 V4-Pro 全量 GA の期待がずれ、中国 AI コミュニティでは創業者梁文鋒への評価が「空約束」から「期待以上」へ反転しましたが、Pro 正式版は依然未届です。
- Harness 依存のベンチマーク:Terminal Bench 2.0(82.7 点 vs V4-Pro プレビュー 67.9 点)等は Harness ミニマルモード・max 設定・top_p=0.95・temperature=1.0 で測定。公式も「harness 選択に極端に敏感」と警告しています。
- 実利用の報告:海外開発者コミュニティでは入力キャッシュヒット率の低さ、安全分類器のタイムアウト等が報告され、ベンチマークと実運用のギャップが指摘されています。
- キルライン圧力:「十分な性能+極端な低価格」の組み合わせが同業の価格戦略を逼迫。GPT-5.6 Luna 80% 値下げ等の背景要因の一つです。
[ SECTION_02 ] // SPECS V4-Flash-0731 コアデータ:284B/13B 不変で何が変わったか
| 項目 | 値 |
|---|---|
| リリース日 | 2026 年 7 月 31 日(API 正式版公測) |
| ビルドタグ | V4-Flash-0731 |
| 総パラメータ / 活性パラメータ | 284B / 13B(4 月プレビューと同一) |
| 性能向上の源泉 | アーキ変更なし、後訓練の再実行のみ |
| コンテキストウィンドウ | 100 万 token |
| API 入力(キャッシュミス / ヒット) | $0.14 / $0.0028(百万 token あたり) |
| API 出力 | $0.28(百万 token あたり) |
| ライセンス | MIT(Hugging Face 重み公開済み) |
| Terminal Bench 2.0(DeepSeek 自測・Harness) | 82.7(V4-Pro プレビュー 67.9 を上回る) |
| Artificial Analysis Intelligence Index | 50(第三者独立評価) |
| Artificial Analysis 単タスク平均コスト | $0.03 |
| V4-Pro 正式版 | 未リリース(プレビュー版のみ) |
アーキテクチャ(4 月から変更なし):ハイブリッドアテンション CSA+HCA(DSA スパースアテンション)、流形制約ハイパーコネクション mHC、Muon 最適化器。100 万 token 推論時、V4-Pro は V3.2 比 FLOPs 27%、KV Cache 10%(DeepSeek 技術報告 arXiv:2606.19348、ベンダー自報)。後訓練のみの改善で 284B/13B が 1.6T/49B の V4-Pro プレビューを Agent ベンチで上回った点は、2026 年後半の「規模競争から効率・データ品質競争へ」の象徴です。
[ SECTION_03 ] // COMPARE Harness・Kimi K3・GLM-5.2・Qwen3.8-Max:国産 open weight 横断比較
DeepSeek Harness とは:7 月 31 日 changelog で初公開された自社 Agent 実行フレームワークです。ファイル読み書き、ツール呼び出し、コマンド実行、エンドツーエンド工程タスクを担い、Claude Code 相当として位置づけられます。これまで DeepSeek モデルは Claude Code や OpenCode 等の第三者 Agent に依存してきました。V4-Flash-0731 の Agent ベンチマークはすべて Harness ミニマルモードで測定され、Harness 本体は執筆時点未公開です。
| モデル | 総/活性パラメータ | Artificial Analysis 指数 | 単タスク平均コスト | 出力 API(百万 token) |
|---|---|---|---|---|
| V4-Flash-0731 | 284B / 13B | 50 | $0.03 | $0.28 |
| Kimi K3 | 2.8T / 約 500 億 | 57 | $0.86 | $15 |
| GLM-5.2 | 約 744B / 約 40B | V4-Flash 比約 +1 | 本稿未確認 | 本稿未確認 |
| Qwen3.8-Max | 2.4T / 950 億 | 本稿未確認 | 本稿未確認 | $6 |
| GPT-5.6 Sol | 非公開 | V4-Flash 比約 +9 | $1.86 | 約 $15 |
| Claude Opus 4.8 | 非公開 | 上位 | 高 | $15 |
Artificial Analysis 指数と DeepSeek 自社 Agent ベンチマークは評価手法が異なり、直接加算比較できません。第三者指数では V4-Flash は Kimi K3・GLM-5.2 に若干劣る一方、単タスクコストは Kimi K3 の約 1/29、GPT-5.6 Sol の約 1/62、Claude Fable 5 の約 1/105 です。DeepSeek の狙いは「ベンチマーク第一」ではなく「十分な知能+誰も真似できない価格」—— OpenRouter でプレビュー版が 7 週連続呼び出し量首位だった背景と一致します。
ベンチマークを過信しない四つの理由:
- Harness 未公開:Agent ベンチマークは未リリース Harness ミニマルモード依存。Claude Code・Cursor での独立再現待ちです。
- 公式自身の警告:changelog に「ベンチマークは harness 選択に極端に敏感」と明記されています。
- 実運用報告:キャッシュヒット率低下、安全分類器タイムアウト等、ベンチマークと乖離するフィードバックがあります。
- V4-Pro GA 日付の噂:8 月 10–20 日等は未署名メディア由来。公式は「できるだけ早く」のみです。
[ SECTION_04 ] // DEPLOY V4-Flash-0731 六ステップ導入:API 移行から Agent 本番まで
- レガシー model 名を全リポジトリで検索:
deepseek-chat/deepseek-reasonerは 7 月 24 日停止済みです。CI・環境変数・Secret をスキャンしてください。 - workload 別に V4 命名を選定:軽量チャット・大量バッチ →
deepseek-v4-flash非 think。旧 reasoner 相当 → Flash think モードまたはdeepseek-v4-proプレビュー。 - SDK 設定を更新:
base_urlはhttps://api.deepseek.com据え置き。OpenAI / Anthropic 互換 SDK はmodelのみ変更。think モードはextra_bodyで設定します。 - ピーク・オフピーク料金をスケジュール:平日 09:00–12:00、14:00–18:00(北京時間)は 2 倍予告済み。24 時間 Agent はオフピークへシフト検討。OpenRouter 7 月階層選定も参照してください。
- 階層ルーティングを構築:日常 Agentic Coding は V4-Flash-0731 で処理し、難所は Claude Opus 4.8 や GPT-5.6 Sol にエスカレート。GPT-5.6 値下げ編と併読してください。
- 7×24 Agent 実行環境を固定:長時間 Harness 待ちの Agent オーケストレーションは、スリープするノート PC ではなく常時稼働 macOS ノードが必要です。ヘルプセンターと 注文ページをご覧ください。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Review this Python module for security issues."}]
)
print(response.choices[0].message.content)
[ SECTION_05 ] // FACTS_FAQ 引用可能データ、業界背景、FAQ、7×24 Agent ホストへの収束
- パラメータ不変・後訓練のみ:284B / 13B。性能向上は post-training 再実行(出典:DeepSeek 7/31 changelog)。
- Terminal Bench 2.0:82.7 点、V4-Pro プレビュー 67.9 点超え(Harness ミニマルモード・DeepSeek 自測)。
- Artificial Analysis:Intelligence Index 50、単タスク $0.03(第三者独立評価)。
- Opus 4.8 価格差:入力キャッシュミス約 36 倍、キャッシュヒット約 179 倍、出力約 89 倍安(出典:21 世紀経済報道等、ベンダー公示価格ベース)。
- 1M コンテキスト効率:V4-Pro は V3.2 比 FLOPs 27%、KV Cache 10%(出典:arXiv:2606.19348)。
- API のみ更新:7/31 時点で App・Web チャットは旧版のまま(出典:DeepSeek changelog)。
- V4-Pro / Harness:「できるだけ早く」リリース予定、具体日未公表。
業界背景:7 月 31 日 V4-Flash-0731 公測当日、Nvidia・Broadcom・AMD 等の算力株に大きな変動はありませんでした。2025 年初の DeepSeek-R1 時の AI チップ株急落と対照的で、市場は「より少ない算力で同等効果」を通常の工程革新として受け止め始めています。同週 Kimi K3 重み公開、8 月 Qwen3.8-Max GA と重なり、国産 open weight 三強の価格・Agent 能力競争が加速しています。
FAQ 抜粋:
- Q:V4-Flash-0731 は V4-Pro より強いですか?A:Agent ベンチでは Harness 測定で上回りますが、 harness 依存です。複雑推論では Pro プレビューが有利な場面もあります。
- Q:V4-Pro 正式版はいつですか?A:未確認。8 月 10–20 日は噂レベルです。
- Q:ベンチマークは信頼できますか?A:SWE-bench Verified 等は参考になります。Terminal Bench 2.0 等は Harness 依存で独立再現待ちです。
- Q:deepseek-chat 移行は?A:7/24 停止済み。
deepseek-v4-flashへ更新してください。 - Q:Harness とは?A:DeepSeek 初の自社 Agent フレームワーク。7/31 初公開、本体は未リリース。
以下は執筆時点の公開ソースです。上流が更新された場合は原文を正としてください。
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash
https://arxiv.org/abs/2606.19348
代替構成の実務上の欠点:① 16GB ノート PC で 284B 重みのローカル推論を試すと、ds4 でも 96GB 以上の統一メモリが実質要件で、API fallback ではハード上限を超えられません。② 蓋を閉じるとスリープし OAuth が切れ、7 週連続 OpenRouter 首位級の Agent バッチが中断します。③ V4-Flash Agent 検証のために高配 Mac Studio を買い、3 か月放置すると週次レンタルの数倍の減価償却が発生します。284B 級推論は API 経由が正しく、ローカルに必要なのは安定した macOS Agent オーケストレーション面だけです。ds4 ローカル推論編を参照してください。
専有 Apple Silicon、7×24 常時稼働、日/週/月の弾力スケールで、macOS ホスト上に V4-Flash API 駆動の Agent(Claude Code、OpenClaw、OpenCode 等)と iOS CI を同居させたい開発者と AI 自動化チームには、NOVAKVM の Mac Mini クラウドベアメタルレンタルが通常はより適した選択です。六地域ノード、高メモリ構成、SSH 直結で、DeepSeek API 推論と裸金属 macOS 実行面を分離し、多ノードクラスタ自前構築とノート PC スリープの二重の罠を避けられます。NOVAKVM 料金ページで M4 Pro とストレージ拡張を比較し、注文ページで試験機を起動してください。リモート接続は ヘルプセンターをご参照ください。