DeepSeek V4 Flash 正式版上線:
跑分逼近 Opus 4.8,價格卻只要幾十分之一,Pro 版還要再等等

若你是正在評估 DeepSeek API 遷移、Agent 工作流降本或國產旗艦模型選型的 AI 開發者與技術負責人,7 月 31 日正式 GA 的 DeepSeek V4-Flash-0731 很可能改寫你對「小模型、大能力」的預期:284B/13B 架構不變,靠後訓練強化在 Agent 基準上全面超越自家 V4-Pro 預覽版,離峰輸出價僅 $0.28/M tokens,約為 Claude Opus 4.8 的 1/36 至 1/179。本文涵蓋四月至今時間軸、六大痛點、定價與競品對照表、CSA+HCA 架構要點、Artificial Analysis 性價比、Harness 爭議、六步接入清單、五則 FAQ 與可引用硬核數據;V4-Pro 正式版與 Harness 完整基準截至 8 月 5 日仍未釋出。可與 V4 GA 篇Kimi K3 開源篇Qwen3.8-Max 篇 交叉閱讀。定價見 定價頁,下單見 雲端訂購頁

DeepSeek V4 系列關鍵時間軸(2026 年 4–8 月)
日期 事件
4 月 24 日 V4 預覽版上線並開源(MIT),含 V4-Pro(1.6T)與 V4-Flash(284B)
7 月 24 日 deepseek-chat / deepseek-reasoner 永久下線,存量專案須完成模型名遷移
7 月 27 日 月之暗面釋出 Kimi K3 完整權重,2.8T MoE 加劇國產旗艦競爭
7 月 31 日 V4-Flash-0731 正式版 API 上線;Harness Agent 框架首次命名,minimal 模式基準未釋出
8 月 5 日(本文發布日) V4-Pro 正式版仍 TBD;社群傳 8 月 10–20 日窗口未獲官方確認
  • Pro 正式版空窗:Flash 已 GA,V4-Pro 正式版與 Harness 完整基準仍未公開,生產環境若需 1.6T 滿血能力只能暫用 Pro 預覽 API 或等待官方公告。
  • Harness 依賴跑分:7 月 31 日公布的 Agent 提升高度綁定 Harness 框架設定,minimal 模式基準未釋出,第三方難以同條件覆核。
  • 快取命中不穩:Prompt Cache 計費規則對前綴長度、TTL 說明有限,部分團隊反映快取命中率低於預期,帳單仍按未命中費率結算。
  • 峰谷計費排程:工作日 09:00–12:00、14:00–18:00(北京時間)費率翻倍,7×24 Agent 流水線不做分時策略,成本可能超出 Flash 低價預期。
  • API-only 限制:0731 正式版目前僅提供 API,權重未重新釋出,資料不出境場景無法立即本地部署最新後訓練版本。
  • 謠言與資訊雜訊:V4-Pro 發布日期(8 月 10–20 日)、新一輪融資等傳聞在社群流傳,截至發稿均未獲 DeepSeek 官方確認

一句話結論:V4-Flash-0731 證明「架構不變、後訓練強化」也能在 Agent 場景碾壓自家 Pro 預覽版,但 Pro 正式版空窗與 Harness 方法論透明度,仍是工程師選型前必須正視的風險。

V4-Flash-0731 維持預覽版規格:2840 億總參數、130 億激活、1M token 上下文、384K 最大輸出。官方強調後訓練(post-training)專項強化 Agent 編排、工具呼叫與程式碼修復,底層創新仍為 CSA+HCA 混合注意力mHC 流形約束超連接Muon 優化器。同系列 V4-Pro 在 1M 上下文場景下,推理 FLOPs 僅為 V3.2 的 27%,KV Cache 記憶體僅為 V3.2 的 10%(廠商報告,來源 arXiv:2606.19348)。

V4-Flash-0731 vs V4-Pro 預覽版規格對照
規格 V4-Flash-0731 V4-Pro 預覽版
總參數/激活 284B/13B 1.6T/49B
Transformer 層數 43 層 61 層
上下文視窗 1,000,000 tokens 1,000,000 tokens
0731 Agent 基準 全面超越 Pro 預覽版(官方 Harness 測試) 被 0731 Flash 反超
正式版狀態 API GA(7 月 31 日) 預覽版可用,正式版 TBD
開源協議 MIT(權重待更新) MIT
旗艦模型 API 定價對照(離峰 Off-Peak,每百萬 token,2026 年 8 月初)
模型 輸入(未命中/命中) 輸出 相對 Flash 輸出倍率
V4-Flash-0731 $0.14/$0.0028 $0.28
V4-Pro 預覽版 $0.435/$0.003625 $0.87 3.1×
Kimi K3 $3.00/$0.30 $15.00 53.6×
Qwen3.8-Max $2.00/— $6.00 21.4×
Claude Opus 4.8(參考) 約 $10.00/— 約 $50.00 約 179×

以離峰輸出價計,V4-Flash 約為 Claude Opus 4.8 的 1/179;即便對照 V4-Pro 預覽版輸出 $0.87/M,Flash 仍便宜約 3.1 倍,且在官方 Harness Agent 基準上能力反超 Pro 預覽——這是 0731 發布後開發者社群最關注的「性價比反轉」。

Artificial Analysis 指數任務性價比(公開資料,發版後請複核)
模型 指數得分 每次任務成本 相對 Flash 分數差
DeepSeek V4-Flash-0731 50 $0.03 基準
Kimi K3 57 $0.86 +7 分,成本約 28.7×
GPT-5.6 Sol 59 $1.86 +9 分,成本約 62×
Claude Fable 5 59 $3.15 +9 分,成本約 105×

Artificial Analysis 給出的訊號很直白:Flash 以 $0.03/次 拿到指數 50,Kimi K3 多 7 分卻要 $0.86;GPT-5.6 Sol 與 Claude Fable 5 僅高 9 分,成本分別飆到 $1.86$3.15。若你的 Agent 工作流以高頻次、可容忍小幅品質差距的場景為主,0731 Flash 的邊際成本優勢難以被忽略。

Harness 框架與跑分爭議:DeepSeek 在 7 月 31 日首次命名 Harness Agent 測試框架,用於多步工具編排、長鏈路任務與 minimal 模式評估。問題在於:對外公布的「超越 Pro 預覽版」數據高度依賴 Harness 特定設定,minimal 模式基準尚未釋出,Artificial Analysis 等中立平台無法在相同條件下覆核。社群亦反映 Prompt Cache 命中率不穩、帳單與預期不符等實務問題。

產業背景(7 月 31 日當週):DeepSeek 創辦人梁聖(社群暱稱「梁白開」)在內部信中提及「斬殺線」(kill line)——指 Agent 能力門檻將淘汰一批舊模型與舊工作流。同日 A 股/港股 AI 晶片板塊反應偏平淡,市場解讀為「能力躍升已在預期內、定價戰才是主敘事」。新一輪融資傳聞同樣未獲官方確認

  1. 遷移模型名稱:將存量 deepseek-chatdeepseek-reasoner 及舊版 Flash 字串,統一改為 deepseek-v4-flash(0731 正式版);在程式碼儲存庫、CI 設定、Secret 管理與 OpenRouter 路由表中全庫搜尋替換。參見 V4 GA 遷移篇
  2. 選型 Flash vs Pro:高頻路由、工具分流、長 System Prompt 快取場景優先 0731 Flash;需 Think Max 或 1.6T 極限推理暫用 deepseek-v4-pro 預覽 API,並追蹤 V4-Pro 正式版公告。
  3. 設定 API 用戶端:base URL 保持 https://api.deepseek.com,OpenAI SDK 僅改 model 參數;思考模式透過 extra_body 傳入 thinking 設定。Anthropic SDK 相容路徑同理更新模型 ID。
  4. 配置快取策略:固定 System Prompt 與重複前綴以爭取快取命中($0.0028/M 輸入);在 Staging 實測命中率後再排程高峰批次;非即時任務排到離峰時段(18:00 後或 09:00 前,北京時間)。
  5. Agent Harness 測試:在自有業務場景跑 A/B 對照(0731 Flash vs Kimi K3 vs GPT-5.6 Sol),勿僅依賴官方 Harness 分數;記錄 Tool Calling 成功率、平均步數與單次任務成本。
  6. 固化 7×24 macOS 宿主:長時 Agent 編排、Harness 迴歸測試與 iOS CI 同機驗證須跑在常駐 macOS 節點;筆電合蓋 sleep 會中斷 OAuth 與批次流水線。詳見 說明中心訂購頁
v4-flash-0731-api.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "You are an agent orchestrator..."},
        {"role": "user", "content": "Run the deployment checklist."}
    ],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 4096}}
)
print(response.choices[0].message.content)

  • 284B/13B 架構不變:0731 正式版參數規模與 4 月預覽版相同,能力提升來自後訓練強化(來源:DeepSeek 7 月 31 日 API 公告)。
  • Agent 反超 Pro 預覽:官方 Harness 測試中,0731 Flash 在 Agent、程式碼與工具呼叫基準全面超越 V4-Pro 預覽版(來源:DeepSeek 官方材料,minimal 模式基準待釋出)。
  • Artificial Analysis 性價比:Flash 指數 50、每次 $0.03;Kimi K3 57/$0.86;GPT-5.6 Sol 59/$1.86;Fable 5 59/$3.15(來源:Artificial Analysis,發版後複核)。
  • 定價碾壓 Opus 4.8:Flash 離峰輸出 $0.28/M,約為 Claude Opus 4.8(約 $50/M 輸出)的 1/179;輸入快取命中 $0.0028/M 接近零邊際成本(來源:DeepSeek 定價頁與 Anthropic 公開價目)。
  • 1M 上下文效率:V4-Pro 在 1M token 場景推理 FLOPs 為 V3.2 的 27%,KV Cache 記憶體為 10%(來源:arXiv:2606.19348)。
  • Pro 正式版空窗:截至 2026-08-05,V4-Pro 正式版與 Harness minimal 基準均未釋出;8 月 10–20 日傳聞未獲官方確認。

FAQ 精選:

  • Q:V4-Flash-0731 和 4 月預覽版有什麼差別?A:參數規模完全相同,差異在後訓練強化——0731 在 Agent 基準全面超越 V4-Pro 預覽版,架構(CSA+HCA、mHC、Muon)未改。目前僅 API,權重待更新。
  • Q:V4-Pro 正式版什麼時候上線?8 月 10–20 日的傳聞可信嗎?A:截至 8 月 5 日仍未發布,Harness 完整基準同樣未公開。社群窗口傳聞未獲官方確認,請以 API 文件與郵件通知為準。
  • Q:Harness 是什麼?為什麼跑分被質疑?A:DeepSeek 命名的 Agent 測試框架,部分對外跑分高度依賴其特定設定,minimal 模式基準未釋出,第三方難以同條件覆核。
  • Q:Flash 和 Pro 該怎麼選?A:多數 Agent 場景先切 0731 Flash 降本;需 1.6T 滿血或 Think Max 暫用 Pro 預覽 API,並追蹤正式版公告。
  • Q:快取命中計費為什麼有爭議?A:Prompt Cache 對前綴重複度與 TTL 規則說明有限,部分場景命中率低於預期。建議 Staging 實測後再排程高峰批次。

下列為撰寫時依據的公開來源;若上游更新,請以原文為準。

https://api.deepseek.com

https://arxiv.org/abs/2606.19348

https://artificialanalysis.ai

替代方案的真實缺點(工程視角):① 只用 Claude Opus 4.8 或 GPT-5.6 Sol 跑高頻 Agent,單次 $1.86–$3.15 的邊際成本在月級 Token 量下難以控管;② 在 16GB 筆電上硬等 0731 權重本地部署,API-only 空窗期無解,sleep 還會中斷長鏈路 Harness 測試;③ 為驗證 DeepSeek Agent 工作流一次性買斷高配 Mac Studio,閒置折舊遠高於按週租用,且 Flash 推理應走 API、本地只需穩定 macOS 編排面。

對需要獨佔 Apple Silicon、7×24 線上、按天/週/月彈性擴容、在 macOS 宿主上穩定跑 DeepSeek V4-Flash API 驅動的 Agent(OpenClaw、Hermes Agent、Claude Code 等)與 iOS CI 同機驗證的開發者與 AI 自動化團隊,NOVAKVM 的 Mac Mini 雲端裸機租賃通常是更優解:六地節點、高記憶體檔位、SSH 直連,把 Flash API 推理與裸機 macOS 執行面分層——雲端極低價旗艦模型呼叫+本地 Agent 編排,避開筆電 sleep 中斷與自建多節點叢集雙重陷阱。請在 NOVAKVM 定價頁 對照 M4 Pro 與儲存擴容,在 訂購頁 拉起試驗機;遠端連線見 說明中心