DeepSeek V4 Flash 正式版上线:
跑分逼近 Opus 4.8,价格却只要几十分之一,Pro 版还要再等等

若你是正在评估 Agent 批处理 API 成本、从 deepseek-chat 迁移到 V4 命名,或在中国开源大模型混战中选型的 AI 开发者与技术负责人,7 月 31 日上线的 DeepSeek V4-Flash-0731 正式版值得优先读懂:参数规模不变(284B 总参数 / 13B 激活),性能提升完全来自后训练,Agent 跑分反超自家更大的 V4-Pro 预览版,价格仅为 Claude Opus 4.8 的几十分之一,而旗舰 V4-Pro 官方版与自研 Agent 框架 Harness 仍未发布。本文覆盖三个月时间线、核心定价表、CSA+HCA 架构与 Harness 拆解、与 Kimi K3 / GLM-5.2 / Qwen3.8-Max 横向对比、跑分争议、「斩杀线」价格战背景、六步迁移清单与 FAQ;可与 V4 满血版 GA 篇Kimi K3 开源篇Qwen3.8-Max 发布篇 交叉阅读。定价见 定价页

  • 2026 年 4 月 24 日:DeepSeek-V4 预览版首次发布并开源,含 V4-Pro(1.6T / 49B 激活)与 V4-Flash(284B / 13B 激活),均支持 100 万 token 上下文,MIT 协议。
  • 2026 年 7 月 24 日:旧接口 deepseek-chatdeepseek-reasoner 正式停用,全部流量切换到 V4 系列命名。
  • 2026 年 7 月 27 日:月之暗面 Kimi K3(2.8T 总参数)开源权重上线 Hugging Face,给 DeepSeek 制造竞争压力。
  • 2026 年 7 月 31 日:DeepSeek-V4-Flash-0731 正式版进入 API 公测,开源权重同步上线 Hugging Face;changelog 首次点名自研 Agent 框架「Harness」,称即将随 V4 正式版发布。仅限 API,App 与网页端暂未同步。
  • 截至 2026 年 8 月 5 日:V4-Pro 官方版仍是「尽快发布」,无官方确认日期;媒体援引未署名消息源称 8 月 10–20 日 GA 窗口——未经 DeepSeek 官方证实,仅供参考

工程痛点(发稿时仍须正视):

  • 不是新模型,是重训:架构与 4 月预览版完全相同,若团队预期「更大参数 = 更强能力」,选型逻辑需切换到「后训练质量」维度。
  • Pro 与 Harness 仍悬空:旗舰 V4-Pro 官方版与 DeepSeek Harness 均未公开发布,Agent 跑分依赖尚未公开的 Harness 极简模式。
  • API-only 割裂体验:消费端 App / 网页未同步 0731 构建,生产 API 与日常聊天入口可能版本不一致。
  • 跑分对 Harness 高度敏感:Terminal Bench 2.0 等 Agent 类分数官方自己提示不能简单等同于模型通用能力。
  • 海外开发者反馈可用性问题:据 21 世纪经济报道援引社区反馈,正式版存在输入缓存命中率偏低、安全分类器偶发超时等细节,与「跑分暴涨」叙事形成反差。

主流模型定价与参数对照(厂商自报,截至 2026-08-05)
模型 状态 总参数 / 激活 输入价(未命中/命中缓存,$/M) 输出价($/M) 协议
DeepSeek-V4-Flash-0731 官方正式版(07-31) 284B / 13B $0.14 / $0.0028 $0.28 MIT
DeepSeek-V4-Pro 预览版(官方版未发布) 1.6T / 49B $0.435 / $0.003625 $0.87 MIT
Kimi K3 权重开源(07-27) 2.8T / ~104B(社区估算) $3.00 / $0.30 $15.00 Kimi K3 License
GLM-5.2 开源(2026 年 6 月) ~744B / ~40B 本文未独立核实 MIT
Qwen3.8-Max API GA(08-02,权重待放) 2.4T / 95B $2.00 / ~$0.17–0.25 $6.00 承诺开源

DeepSeek 已预告未来 API 将在北京时间 9–12 点、14–18 点高峰时段2 倍加价,截至发稿未公布具体生效日期。相对 Claude Opus 4.8,据 21 世纪经济报道援引的公开比价,V4-Flash 在缓存未命中输入约便宜 36 倍、缓存命中输入约 179 倍、输出约 89 倍——均为厂商标价,非独立审计。

架构未变,变的是后训练:V4-Flash-0731 与 4 月预览版参数规模与结构完全相同,官方明确性能提升完全来自重新后训练。284B/13B 的 Flash 在多项 Agent 基准上超过 1.6T/49B 的 V4-Pro 预览版——2026 年下半年竞争焦点正从「堆参数」转向「后训练数据与方法」。

技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》披露三项架构改动(预览版已引入,正式版沿用):

  1. 混合注意力(CSA + HCA):对外称 DSA 稀疏注意力,降低长上下文计算与显存;
  2. 流形约束超连接(mHC):改进传统残差连接;
  3. Muon 优化器:替换传统优化器,提升训练收敛与稳定性。

官方指标(尚未见独立第三方复现):100 万 token 上下文下,V4-Pro 相对 V3.2 单 token 推理 FLOPs 仅为 27%,KV Cache 占用仅为 10%

Harness 首次亮相:7 月 31 日 changelog 正式命名 DeepSeek Harness——自研 Agent 执行框架,对标 Claude Code。此前 DeepSeek 模型主要依赖 Claude Code、OpenCode 等第三方工具。官方 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部用 Harness「极简模式」测出,且框架尚未公开发布;官方原话:跑分对 harness 选择非常敏感。

Artificial Analysis 第三方指数 vs 单任务成本(与厂商自报跑分分开列示)
模型 Intelligence Index 单任务平均成本 备注
DeepSeek-V4-Flash-073150$0.03第三方独立
Kimi K357$0.86第三方独立
GLM-5.2比 Flash 高约 1 分本文未核实第三方独立
GPT-5.6 Sol比 Flash 高 9 分以上$1.86闭源
Claude Fable 5比 Flash 高 9 分以上$3.15闭源

反差结论:V4-Flash 在第三方指数上并非最高,甚至落后于 Kimi K3 与 GLM-5.2;但单任务成本约为 Kimi K3 的 1/29、GPT-5.6 Sol 的 1/62、Claude Fable 5 的 1/105。DeepSeek 打的是「够用智能 + 极致价格」,而非「跑分第一」——这也解释预览版为何曾连续七周稳坐 OpenRouter 调用量第一。

争议点(避免过度解读):

  • Terminal Bench 2.0 上 Flash 0731 得 82.7、V4-Pro 预览版 67.9——基于 Harness minimal mode、max 档位、top_p=0.95、temperature=1.0,应视为「厂商 + 特定框架」结果。
  • V4-Pro GA 与 Harness 上线时间未经官方证实;融资/IPO 传闻(约 74 亿美元融资、487 亿美元估值等)目前来自财经媒体「据报道」,无监管备案或 DeepSeek 官方确认。
  • 中文社区「斩杀线」:DeepSeek「够用性能 + 极端低价」组合迫使友商要么明显更强、要么更便宜——同期 GPT-5.6 Luna 降价 80% 的媒体报道可与此对照。

  1. 完成模型名迁移:将存量 deepseek-chat / deepseek-reasoner 替换为 deepseek-v4-flashdeepseek-v4-pro;OpenAI / Anthropic 兼容客户端通常只需改 model 字段。详见 V4 GA 迁移篇
  2. Flash vs Pro 路由:批量 Agent、代码流水线、成本敏感场景优先 Flash-0731;复杂推理且预算充足可暂用 Pro 预览版,待官方 Pro GA 后再评估切换。
  3. 配置 API 端点与 Key:在 DeepSeek 控制台获取 API Key,base URL 指向官方文档端点;发版后请重新打开链接核对。
  4. 设计缓存与峰谷策略:长系统 prompt 尽量命中缓存($0.0028/M 输入);7×24 Agent 须规划北京时间高峰 2 倍加价窗口(已预告未生效)。
  5. Agent 工具链 A/B 测试:在 Claude Code、Cursor、OpenCode 等实际 harness 上对比 Flash 0731 与竞品,勿仅信 Terminal Bench 厂商自报分。参见 7 月 OpenRouter 分层选型
  6. 固化 7×24 macOS Agent 宿主:长时 Harness 类任务须跑在常驻 macOS 节点;笔电合盖 sleep 会中断 OAuth 与批任务。详见 帮助中心订购页
deepseek-v4-flash-api.py
# OpenAI SDK 兼容示例(发版后请以 api-docs.deepseek.com 核对)
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Summarize MoE post-training gains in one paragraph."}],
    temperature=1.0,
    top_p=0.95
)
print(response.choices[0].message.content)

  • 参数不变、后训练增益:284B 总参数 / 13B 激活,架构与 4 月预览版相同(来源:DeepSeek 官方 changelog,2026-07-31)。
  • Terminal Bench 2.0:Flash-0731 官方报 82.7 vs V4-Pro 预览 67.9(Harness minimal mode,厂商自报)。
  • 百万上下文效率:V4-Pro 相对 V3.2 在 1M token 下 FLOPs 27%、KV Cache 10%(来源:DeepSeek 技术报告,待独立复现)。
  • Artificial Analysis:Intelligence Index 50,单任务成本 $0.03(第三方,经财经媒体转引)。
  • 上下文窗口:Flash 与 Pro 均为 1M token,MIT 开源权重(来源:Hugging Face 模型卡)。
  • 资本市场侧面:7 月 31 日 V4-Flash 正式版上线当天,英伟达、博通、AMD 等算力股未明显波动——与 2025 年初 R1 发布时芯片股集体下跌形成对比。

社区情绪:V4-Pro 迟迟未兑现「7 月中旬全量上线」预期时,中文 AI 社区曾戏称创始人梁文锋「梁白开」;Flash-0731 超预期后又称「梁圣」——戏谑昵称反转本身是观察社区情绪的有趣侧面。

FAQ 精选:

  • Q:V4 和 V3.2 最大区别?A:原生 1M 上下文 + 长上下文计算/显存大幅下降 + Agent 专项优化。
  • Q:Flash 还是 Pro?A:大规模低成本调用选 Flash-0731;复杂推理且预算足可暂用 Pro 预览版。
  • Q:V4 Pro 官方版能用吗?A:截至 8 月 5 日不能,仅 Flash-0731 官方版且 API-only。
  • Q:跑分能信吗?A:SWE-bench Verified 等第三方基准较可信;Terminal Bench 等 Harness 依赖分数须等独立复现。
  • Q:对开发者实际影响?A:deepseek-v4-flash 自动指向新官方版;旧名须尽快切换。

下列为撰写时依据的公开来源;若上游更新,请以原文为准。

https://api-docs.deepseek.com

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash

https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro

替代方案的真实缺点(工程视角):① 在 16GB 笔电上硬跑 284B 级权重或长上下文 Agent,统一内存与磁盘瞬间饱和,API 再便宜也救不了本地硬件天花板;② 笔电合盖 sleep 后 OAuth 过期、Harness 类长时批任务中断,OpenRouter 调用量第一的模型无法完成 7×24 流水线;③ 为验证 DeepSeek Agent 工作流一次性买断高配 Mac Studio,3 个月闲置折旧远高于按周租用——推理应走 API,本地只需稳定 macOS Agent 编排面。

对需要独占 Apple Silicon、7×24 在线、按天/周/月弹性扩容、在 macOS 宿主上稳定跑 DeepSeek V4-Flash API 驱动的 Agent(Claude Code、OpenCode、Cursor 等)与 iOS CI 同机验证的开发者与 AI 自动化团队,NOVAKVM 的 Mac Mini 云端裸金属租赁通常是更优解:六地节点、高内存档位、SSH 直连,把 DeepSeek API 推理与裸金属 macOS 执行面分层——云端极致性价比调用 + 本地 Agent 编排,避免自托管大模型与笔记本 sleep 中断的双重陷阱。请在 NOVAKVM 定价页 对照 M4 Pro 与存储扩容,在 订购页 拉起试验机;远程会话见 帮助中心