若你是正在评估 Agent 批处理 API 成本、从 deepseek-chat 迁移到 V4 命名,或在中国开源大模型混战中选型的 AI 开发者与技术负责人,7 月 31 日上线的 DeepSeek V4-Flash-0731 正式版值得优先读懂:参数规模不变(284B 总参数 / 13B 激活),性能提升完全来自后训练,Agent 跑分反超自家更大的 V4-Pro 预览版,价格仅为 Claude Opus 4.8 的几十分之一,而旗舰 V4-Pro 官方版与自研 Agent 框架 Harness 仍未发布。本文覆盖三个月时间线、核心定价表、CSA+HCA 架构与 Harness 拆解、与 Kimi K3 / GLM-5.2 / Qwen3.8-Max 横向对比、跑分争议、「斩杀线」价格战背景、六步迁移清单与 FAQ;可与 V4 满血版 GA 篇、Kimi K3 开源篇、Qwen3.8-Max 发布篇 交叉阅读。定价见 定价页。
[ SECTION_01 ] // TIMELINE 从 4 月预览到 7 月「官方版」:DeepSeek V4 Flash 时间线与五大痛点
- 2026 年 4 月 24 日:DeepSeek-V4 预览版首次发布并开源,含 V4-Pro(1.6T / 49B 激活)与 V4-Flash(284B / 13B 激活),均支持 100 万 token 上下文,MIT 协议。
- 2026 年 7 月 24 日:旧接口
deepseek-chat与deepseek-reasoner正式停用,全部流量切换到 V4 系列命名。 - 2026 年 7 月 27 日:月之暗面 Kimi K3(2.8T 总参数)开源权重上线 Hugging Face,给 DeepSeek 制造竞争压力。
- 2026 年 7 月 31 日:DeepSeek-V4-Flash-0731 正式版进入 API 公测,开源权重同步上线 Hugging Face;changelog 首次点名自研 Agent 框架「Harness」,称即将随 V4 正式版发布。仅限 API,App 与网页端暂未同步。
- 截至 2026 年 8 月 5 日:V4-Pro 官方版仍是「尽快发布」,无官方确认日期;媒体援引未署名消息源称 8 月 10–20 日 GA 窗口——未经 DeepSeek 官方证实,仅供参考。
工程痛点(发稿时仍须正视):
- 不是新模型,是重训:架构与 4 月预览版完全相同,若团队预期「更大参数 = 更强能力」,选型逻辑需切换到「后训练质量」维度。
- Pro 与 Harness 仍悬空:旗舰 V4-Pro 官方版与 DeepSeek Harness 均未公开发布,Agent 跑分依赖尚未公开的 Harness 极简模式。
- API-only 割裂体验:消费端 App / 网页未同步 0731 构建,生产 API 与日常聊天入口可能版本不一致。
- 跑分对 Harness 高度敏感:Terminal Bench 2.0 等 Agent 类分数官方自己提示不能简单等同于模型通用能力。
- 海外开发者反馈可用性问题:据 21 世纪经济报道援引社区反馈,正式版存在输入缓存命中率偏低、安全分类器偶发超时等细节,与「跑分暴涨」叙事形成反差。
[ SECTION_02 ] // SPECS DeepSeek V4 Flash 正式版核心数据:定价、参数与协议一览
| 模型 | 状态 | 总参数 / 激活 | 输入价(未命中/命中缓存,$/M) | 输出价($/M) | 协议 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 官方正式版(07-31) | 284B / 13B | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 预览版(官方版未发布) | 1.6T / 49B | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 权重开源(07-27) | 2.8T / ~104B(社区估算) | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| GLM-5.2 | 开源(2026 年 6 月) | ~744B / ~40B | 本文未独立核实 | MIT | |
| Qwen3.8-Max | API GA(08-02,权重待放) | 2.4T / 95B | $2.00 / ~$0.17–0.25 | $6.00 | 承诺开源 |
DeepSeek 已预告未来 API 将在北京时间 9–12 点、14–18 点高峰时段2 倍加价,截至发稿未公布具体生效日期。相对 Claude Opus 4.8,据 21 世纪经济报道援引的公开比价,V4-Flash 在缓存未命中输入约便宜 36 倍、缓存命中输入约 179 倍、输出约 89 倍——均为厂商标价,非独立审计。
[ SECTION_03 ] // ARCHITECTURE 后训练如何「变出」性能?架构、Harness 与中国开源六边形混战
架构未变,变的是后训练:V4-Flash-0731 与 4 月预览版参数规模与结构完全相同,官方明确性能提升完全来自重新后训练。284B/13B 的 Flash 在多项 Agent 基准上超过 1.6T/49B 的 V4-Pro 预览版——2026 年下半年竞争焦点正从「堆参数」转向「后训练数据与方法」。
技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》披露三项架构改动(预览版已引入,正式版沿用):
- 混合注意力(CSA + HCA):对外称 DSA 稀疏注意力,降低长上下文计算与显存;
- 流形约束超连接(mHC):改进传统残差连接;
- Muon 优化器:替换传统优化器,提升训练收敛与稳定性。
官方指标(尚未见独立第三方复现):100 万 token 上下文下,V4-Pro 相对 V3.2 单 token 推理 FLOPs 仅为 27%,KV Cache 占用仅为 10%。
Harness 首次亮相:7 月 31 日 changelog 正式命名 DeepSeek Harness——自研 Agent 执行框架,对标 Claude Code。此前 DeepSeek 模型主要依赖 Claude Code、OpenCode 等第三方工具。官方 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部用 Harness「极简模式」测出,且框架尚未公开发布;官方原话:跑分对 harness 选择非常敏感。
| 模型 | Intelligence Index | 单任务平均成本 | 备注 |
|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 50 | $0.03 | 第三方独立 |
| Kimi K3 | 57 | $0.86 | 第三方独立 |
| GLM-5.2 | 比 Flash 高约 1 分 | 本文未核实 | 第三方独立 |
| GPT-5.6 Sol | 比 Flash 高 9 分以上 | $1.86 | 闭源 |
| Claude Fable 5 | 比 Flash 高 9 分以上 | $3.15 | 闭源 |
反差结论:V4-Flash 在第三方指数上并非最高,甚至落后于 Kimi K3 与 GLM-5.2;但单任务成本约为 Kimi K3 的 1/29、GPT-5.6 Sol 的 1/62、Claude Fable 5 的 1/105。DeepSeek 打的是「够用智能 + 极致价格」,而非「跑分第一」——这也解释预览版为何曾连续七周稳坐 OpenRouter 调用量第一。
争议点(避免过度解读):
- Terminal Bench 2.0 上 Flash 0731 得 82.7、V4-Pro 预览版 67.9——基于 Harness minimal mode、max 档位、top_p=0.95、temperature=1.0,应视为「厂商 + 特定框架」结果。
- V4-Pro GA 与 Harness 上线时间未经官方证实;融资/IPO 传闻(约 74 亿美元融资、487 亿美元估值等)目前来自财经媒体「据报道」,无监管备案或 DeepSeek 官方确认。
- 中文社区「斩杀线」:DeepSeek「够用性能 + 极端低价」组合迫使友商要么明显更强、要么更便宜——同期 GPT-5.6 Luna 降价 80% 的媒体报道可与此对照。
[ SECTION_04 ] // DEPLOY DeepSeek V4 Flash 六步接入清单:从 API 迁移到 Agent 生产落地
- 完成模型名迁移:将存量
deepseek-chat/deepseek-reasoner替换为deepseek-v4-flash或deepseek-v4-pro;OpenAI / Anthropic 兼容客户端通常只需改 model 字段。详见 V4 GA 迁移篇。 - Flash vs Pro 路由:批量 Agent、代码流水线、成本敏感场景优先 Flash-0731;复杂推理且预算充足可暂用 Pro 预览版,待官方 Pro GA 后再评估切换。
- 配置 API 端点与 Key:在 DeepSeek 控制台获取 API Key,base URL 指向官方文档端点;发版后请重新打开链接核对。
- 设计缓存与峰谷策略:长系统 prompt 尽量命中缓存($0.0028/M 输入);7×24 Agent 须规划北京时间高峰 2 倍加价窗口(已预告未生效)。
- Agent 工具链 A/B 测试:在 Claude Code、Cursor、OpenCode 等实际 harness 上对比 Flash 0731 与竞品,勿仅信 Terminal Bench 厂商自报分。参见 7 月 OpenRouter 分层选型。
- 固化 7×24 macOS Agent 宿主:长时 Harness 类任务须跑在常驻 macOS 节点;笔电合盖 sleep 会中断 OAuth 与批任务。详见 帮助中心 与 订购页。
# OpenAI SDK 兼容示例(发版后请以 api-docs.deepseek.com 核对)
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Summarize MoE post-training gains in one paragraph."}],
temperature=1.0,
top_p=0.95
)
print(response.choices[0].message.content)
[ SECTION_05 ] // FACTS_FAQ 可引用硬核数据、行业背景、FAQ 与 7×24 Agent 宿主收束
- 参数不变、后训练增益:284B 总参数 / 13B 激活,架构与 4 月预览版相同(来源:DeepSeek 官方 changelog,2026-07-31)。
- Terminal Bench 2.0:Flash-0731 官方报 82.7 vs V4-Pro 预览 67.9(Harness minimal mode,厂商自报)。
- 百万上下文效率:V4-Pro 相对 V3.2 在 1M token 下 FLOPs 27%、KV Cache 10%(来源:DeepSeek 技术报告,待独立复现)。
- Artificial Analysis:Intelligence Index 50,单任务成本 $0.03(第三方,经财经媒体转引)。
- 上下文窗口:Flash 与 Pro 均为 1M token,MIT 开源权重(来源:Hugging Face 模型卡)。
- 资本市场侧面:7 月 31 日 V4-Flash 正式版上线当天,英伟达、博通、AMD 等算力股未明显波动——与 2025 年初 R1 发布时芯片股集体下跌形成对比。
社区情绪:V4-Pro 迟迟未兑现「7 月中旬全量上线」预期时,中文 AI 社区曾戏称创始人梁文锋「梁白开」;Flash-0731 超预期后又称「梁圣」——戏谑昵称反转本身是观察社区情绪的有趣侧面。
FAQ 精选:
- Q:V4 和 V3.2 最大区别?A:原生 1M 上下文 + 长上下文计算/显存大幅下降 + Agent 专项优化。
- Q:Flash 还是 Pro?A:大规模低成本调用选 Flash-0731;复杂推理且预算足可暂用 Pro 预览版。
- Q:V4 Pro 官方版能用吗?A:截至 8 月 5 日不能,仅 Flash-0731 官方版且 API-only。
- Q:跑分能信吗?A:SWE-bench Verified 等第三方基准较可信;Terminal Bench 等 Harness 依赖分数须等独立复现。
- Q:对开发者实际影响?A:
deepseek-v4-flash自动指向新官方版;旧名须尽快切换。
下列为撰写时依据的公开来源;若上游更新,请以原文为准。
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash
https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
替代方案的真实缺点(工程视角):① 在 16GB 笔电上硬跑 284B 级权重或长上下文 Agent,统一内存与磁盘瞬间饱和,API 再便宜也救不了本地硬件天花板;② 笔电合盖 sleep 后 OAuth 过期、Harness 类长时批任务中断,OpenRouter 调用量第一的模型无法完成 7×24 流水线;③ 为验证 DeepSeek Agent 工作流一次性买断高配 Mac Studio,3 个月闲置折旧远高于按周租用——推理应走 API,本地只需稳定 macOS Agent 编排面。
对需要独占 Apple Silicon、7×24 在线、按天/周/月弹性扩容、在 macOS 宿主上稳定跑 DeepSeek V4-Flash API 驱动的 Agent(Claude Code、OpenCode、Cursor 等)与 iOS CI 同机验证的开发者与 AI 自动化团队,NOVAKVM 的 Mac Mini 云端裸金属租赁通常是更优解:六地节点、高内存档位、SSH 直连,把 DeepSeek API 推理与裸金属 macOS 执行面分层——云端极致性价比调用 + 本地 Agent 编排,避免自托管大模型与笔记本 sleep 中断的双重陷阱。请在 NOVAKVM 定价页 对照 M4 Pro 与存储扩容,在 订购页 拉起试验机;远程会话见 帮助中心。