3か月の待機を経て、DeepSeek V4 満血版(GA 正式版)が 2026 年 7 月 20 日に正式リリースされました。4 月プレビュー版から、Agent・数学推論・コード生成が強化され、初めてピーク・オフピークの差別料金が導入されました。本稿は、引き続き deepseek-chat を使い、7 月 24 日までに移行が必要な開発者と、GPT-5.6・Claude Fable 5・V4 の間で選定中のチーム向けです。7 つの課題から始め、タイムライン、1.6T MoE(CSA+HCA、mHC、Muon)、ベンチマーク、三方比較、料金表、六ステップ移行と引用可能な技術パラメータを整理し、Mac 自ホストと NOVAKVM 高メモリノードでデータ主権の道筋を示します。数値は DeepSeek 公式ドキュメントと arXiv:2606.19348 を正とし、発版後はリンクを再確認してください。料金は 料金ページ、注文は 注文ページです。ds4 ローカル推論編とGPT-5.6 リリース編も併読をおすすめします。
[ SECTION_01 ] // PAIN_MAP DeepSeek V4 GA 前に開発者が抱える7つの課題
- 旧 API の停止:
deepseek-chatとdeepseek-reasonerは 2026 年 7 月 24 日 23:59(北京時間)に永久停止します。モデル名を更新していない本番コードはハードダウンします。 - ピーク料金のスケジューリング:平日 09:00–12:00、14:00–18:00(北京時間)は料金が2倍になります。24 時間 Agent パイプラインを時間帯分けしないと、請求が想定を超える可能性があります。
- Pro と Flash の選定:V4-Pro(1.6T / 49B 活性)と V4-Flash(284B / 13B 活性)では価格と能力の境界が異なります。誤ルーティングは Token 浪費か品質低下につながります。
- クローズド旗艦とのスコア差:Claude Fable 5 は SWE-bench Pro で 80.3%、V4-Pro は 55.4%です。「オープンソース最強」は「業界全体最強」とは限りません。
- 1M コンテキストのコスト:KV Cache は V3.2 の 10% まで圧縮されても、長コンテキスト Agent は算力とメモリを消費します。自ホストには 96GB 以上の統一メモリが実質要件です(ds4 経路参照)。
- データ越境とコンプライアンス:金融・医療・公共部門は MIT オープンソース+プライベートデプロイを好みますが、満血 V4-Pro をローカルで動かすハードコストは非常に高くなります。
- 推論モードの設定:Non-think / Think High / Think Max の三つの段階と、公式推奨
temperature=1.0, top_p=1.0を場面ごとに調整する必要があります。Think Max を無条件で有効にすると遅延と費用が増えます。
[ SECTION_02 ] // ARCHITECTURE プレビューから満血版へ:タイムラインと V4-Pro / Flash アーキテクチャ
| 日付 | イベント |
|---|---|
| 4 月 24 日 | V4 プレビュー公開・MIT オープンソース(V4-Pro 1.6T、V4-Flash 284B) |
| 5 月 | 本番向けチューニング版リリース、API 正式提供 |
| 6 月 | V4-Pro 出力単価を恒久的に 75% 値下げ、$0.87/M tokens |
| 6 月 29 日 | GA は 7 月中旬予定のメール通知、ピーク料金を初公開 |
| 7 月 19 日 | 複数開発者が GA グレー内測資格を取得、メディアが「満血版は明日にも」と報道 |
| 7 月 20 日 | GA 正式版リリース(本稿公開日) |
| 7 月 24 日 | deepseek-chat / deepseek-reasoner 永久停止 |
要点:満血版は Agent・数学推論・コード生成を強化し、正式な商用課金体系を整備しました。MoE 基盤アーキテクチャ自体は変更されていません。
| 項目 | V4-Pro | V4-Flash |
|---|---|---|
| 総パラメータ | 1.6 兆(1.6T) | 2840 億(284B) |
| Token あたり活性パラメータ | 490 億(49B) | 130 億(13B) |
| Transformer 層数 | 61 層 | 43 層 |
| コンテキスト窓 | 1,000,000 tokens | 1,000,000 tokens |
| 最大出力 | 384K tokens | 384K tokens |
| 精度 | FP4(エキスパート重み)+ FP8(その他) | FP4 + FP8 混合 |
| 事前学習データ量 | 33T+ tokens | 32T+ tokens |
| ライセンス | MIT | MIT |
1M コンテキストを支える中核アーキテクチャ:
- ハイブリッドアテンション(CSA + HCA):V2/V3 の MLA をやめ、圧縮スパースアテンション(CSA:KV を Softmax ゲートプーリングで 4 倍圧縮 + FP4 Lightning Indexer で top-k スパース、Pro は top-1024、Flash は top-512、直近 128 token スライディング窓を保持)と重度圧縮アテンション(HCA:128 倍圧縮後にグローバル密集アテンション)を交互に使用。1M シナリオでは推論 FLOPs は V3.2 の 27%、KV Cache メモリは V3.2 の 10%(Flash は 7%)です。
- 多様体制約ハイパーコネクション(mHC):4 チャネル残差ストリーム + 双確率行列制約(Birkhoff 多面体)で 61 層深ネットの勾配伝播を安定化します。
- Muon オプティマイザ:学習時にニュートン–シュルツ直交化で勾配を処理し、AdamW より収束が速く安定します。
| モード | 特徴 | 適用場面 |
|---|---|---|
| Non-think | 思考連鎖なし、最速応答 | 単純 Q&A、ルーティング |
| Think High | 明示的推論(思考連鎖タグ) | 中程度の複雑タスク、コードデバッグ |
| Think Max | 最大推論強度、384K+ コンテキスト必須 | 高度な数学、長鎖 Agent |
公式推奨サンプリング(全モード共通):
temperature=1.0、top_p=1.0。
[ SECTION_03 ] // BENCHMARK ベンチマークと GPT-5.6 / Claude Fable 5 意思決定マトリクス
| ベンチマーク | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(オープンソース最高) | 96.0% | 個別未公開 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
Artificial Analysis のコストパフォーマンス:Claude Fable 5 は Strategy & Ops 指数タスクで 1 回 $3.48・スコア 50、DeepSeek V4-Pro は 1 回 $0.03・スコア 38です。コストは約 116 倍差ですが、スコア差は約 31% です。V4-Flash は六類指数タスクすべて 1 回 $0.04 未満です。
| 観点 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| オープンソース / 自ホスト | MIT、可 | クローズド、不可 | クローズド、不可 |
| コンテキスト窓 | 1M tokens | 未公開 | 1M tokens |
| API 出力単価(通常) | $0.87/M tokens | ~$15/M | $50/M |
| ピーク出力単価 | $1.74/M tokens | — | — |
| Agent 能力 | 強、マルチ Agent 編成可 | 強 | 最強 |
| データプライバシー | プライベートデプロイ可 | 第三者クラウド | 第三者クラウド |
場面別の早見表:予算重視 / 高頻度呼び出し / プライベートデプロイ → V4-Pro または V4-Flash;最高のコード能力・コスト不問 → Claude Fable 5;複雑なアルゴリズム+数学推論 → GPT-5.6 Sol / Ultra;超大規模ログ / 文書処理 → V4-Flash(キャッシュヒット入力 $0.0028/M)。
[ SECTION_04 ] // PRICING ピーク・オフピーク料金:時間帯、価格表、4 つの節約策
GA で最も注目された変更は、電力の時間帯料金に似たピーク・オフピーク差別価格です。ピーク(北京時間)は平日 09:00–12:00 と 14:00–18:00で料金が2倍になります。DeepSeek は変更の 24 時間前にメール通知を約束しています。
| モデル | 課金項目 | 通常(Off-Peak) | ピーク(Peak) |
|---|---|---|---|
| V4-Pro | 入力(キャッシュヒット) | ¥0.025 / $0.0035 / 1M | 2倍 |
| V4-Pro | 入力(キャッシュミス) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 |
| V4-Pro | 出力 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 |
| V4-Flash | 入力(キャッシュヒット) | ¥0.02 / $0.0028 / 1M | 2倍 |
| V4-Flash | 入力(キャッシュミス) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 |
| V4-Flash | 出力 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
- 非リアルタイムをオフピークへ:バッチ文書処理、データラベリング、コードレビューは 18:00 以降または 9:00 前に回します。
- Prompt Cache を活用:繰り返し System Prompt でキャッシュを構築すると、V4-Flash キャッシュヒットは $0.0028/M まで下がります。
- Flash で振り分け:単純な意図判定・ルーティングは V4-Flash、複雑推論は V4-Pro へ。コストを 60–80% 削減できます。
- 請求メールを購読:アカウントメールで料金変更通知を確実に受け取れるようにします。
ピーク時でも V4-Pro 出力($1.74/M)は Claude Opus 4.8($15/M)や GPT-5.6 Sol(約 $15/M)より 8.6 倍安いままです。
[ SECTION_05 ] // MIGRATION 開発者向け:API 移行六ステップ(7 月 24 日 23:59 締切)
重要:旧モデル名 deepseek-chat と deepseek-reasoner は 2026 年 7 月 24 日 15:59 UTC(北京時間 7 月 24 日 23:59)に永久停止します。
| 旧モデル名 | 新モデル名 | 備考 |
|---|---|---|
deepseek-chat |
deepseek-v4-flash(非思考モード) |
高速、軽量タスク向け |
deepseek-reasoner |
deepseek-v4-flash(思考モード) |
または deepseek-v4-pro でより強い推論 |
- 旧モデル名を全庫検索:コードベース、CI 設定、環境変数、Secret 管理で
deepseek-chat、deepseek-reasonerを検索します。 - 場面に応じて新モデルを選定:軽量対話 →
deepseek-v4-flash非思考;旧 reasoner 相当 → Flash 思考モードまたはdeepseek-v4-pro。 - OpenAI SDK 呼び出しを更新:
modelパラメータのみ変更;思考モードはextra_bodyでthinking設定を渡します。 - Anthropic SDK 互換パスを検証:
base_urlはhttps://api.deepseek.comのまま、modelをdeepseek-v4-proまたはdeepseek-v4-flashに更新します。 - Staging 回帰テスト:Tool Calling、ストリーミング、長コンテキストをカバー;Think Max はコンテキスト ≥ 384K を確認します。
- 本番切替と監視:7 月 24 日前にカナリアリリースを完了し、ピーク時間帯の Token 使用量とエラー率を監視、必要なら時間帯スケジューリングを有効にします。
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
公式ドキュメントと論文(発版後はリンクを再確認してください):
https://arxiv.org/abs/2606.19348
[ SECTION_06 ] // FACTS 引用可能な技術情報と Mac 自ホストのまとめ
- SWE-bench Verified 80.6%:現時点のオープンソース最高、Gemini 3.1 Pro と同列。実 GitHub リポジトリの Bug 修正シナリオ(出典:公開ベンチマーク集計、発版後再確認)。
- KV Cache メモリ 10%:1M token シナリオで V4-Pro は V3.2 の 10%、V4-Flash は 7%(出典:arXiv:2606.19348)。
- 116 倍コスト差:Artificial Analysis Strategy & Ops で Fable 5 1 回 $3.48 vs V4-Pro $0.03(出典:Artificial Analysis、発版後再確認)。
- 6 月値下げ:V4-Pro 出力 $0.87/M tokens は史上最高クラスのコスパ区間(出典:DeepSeek 公式料金ページ)。
- MIT オープンソース:V4-Pro と V4-Flash の重みは自ホスト可能、データ非越境向け(出典:HuggingFace モデルページ)。
- 移行ハード締切:2026-07-24 23:59 北京時間以降
deepseek-chat/deepseek-reasonerは永久利用不可(出典:DeepSeek API 告知メール)。
DeepSeek V4 GA は 2026 年オープンソース LLM の最重要マイルストーンの一つです。価値は Claude Fable 5 や GPT-5.6 を今すぐ上回ることではなく、クローズド旗艦の 1/10 から 1/100 のコストで、オープンソース内最高クラスの性能を提供することにあります。
代替案の現実的な欠点:① Claude / GPT クラウド API のみに依存すると、長コンテキスト Agent の月額が膨らみ、コード経路が第三者経由になり監査負荷が増えます;② 16GB ノート PC で汎用推論フレームワークを無理に動かしても満血 V4 重みは載らず、トラブルシュートに時間を失います;③ 数週間の実験のために Mac Studio Ultra を買うと、遊休時の減価償却が高メモリインスタンスの週次レンタルを上回ります。プライベート環境で V4 Flash ローカル推論を検証する場合はds4 + 128GB Mac デプロイ編を参照してください。
データ非越境・予算制約・1M コンテキスト Agent・API コスト最適化を求めるチームにとって、DeepSeek V4 Pro は現時点で欠点の少ないオープンソース選択です。自ホスト実験を再現可能なインフラにするなら、NOVAKVM の Mac Mini クラウドベアメタルレンタルが実務上の最適解になりやすいです。六地域ノード、Apple Silicon 高メモリ専有、日/週/月の弾力契約で、128GB インスタンスを検証期間だけ借りてローカル推論を通し、安定後に自前購入を判断できます。7 月 24 日までに API 移行を完了してください。M4 Pro とストレージ拡張は NOVAKVM 料金ページ、試験機の起動は 注文ページ、リモートセッションは ヘルプセンターをご覧ください。