AI 前沿·阅读约 2 分钟·
DeepSeek-V4-Flash 正式版发布:Agent 能力反超自家 Pro 预览版,输出只要 2 元/百万 token

DeepSeek-V4-Flash 正式版发布:Agent 能力反超自家 Pro 预览版,输出只要 2 元/百万 token

2026年7月31日,DeepSeek-V4-Flash 正式版 API 上线公测:9 项 Agent 基准全面反超 V4-Pro-Preview,原生支持 Responses API 并适配 Codex,输出价格仅 2 元/百万 token。

四月·

原创。DeepSeek-V4-Flash 正式版今天下午上线公测:Agent 能力大幅增强,9 项基准测试全面反超 Pro 预览版,原生支持 OpenAI Responses API 并适配 Codex,输出价格只要 2 元/百万 token。

2026 年 7 月 31 日下午,DeepSeek 通过官方 API 文档发布日志,宣布 DeepSeek-V4-Flash 正式版 API 上线公测,模型版本号为 DeepSeek-V4-Flash-0731。距离 4 月 24 日 V4 系列预览版发布,刚好过去了三个多月。

这条消息本身不算意外——6 月 29 日 DeepSeek 就通过邮件官宣 V4 正式版计划 7 月中旬上线,并同步引入「峰谷定价」机制。真正的意外在成绩单里:这次正式版把 Agent 能力拉到了一个离谱的位置,多项基准测试远超自家的 V4-Pro-Preview,用更便宜的价格交出了更强的干活能力。

一、9 项 Agent 基准:反超 Pro 预览版

官方一口气公布了 9 项 Agent 基准测试成绩,覆盖终端操作、代码仓库理解、网络安全对抗、端到端软件开发等场景:

基准测试得分考察内容
Terminal Bench 2.182.7终端环境下的任务执行能力
Cybergym76.7网络安全对抗
Toolathlon verified70.3工具调用
DSBench-FullStack68.7全栈开发(内部测试集)
DSBench-Hard59.6Coding Agent 难题(内部测试集)
NL2Repo54.2自然语言生成代码仓库
DeepSWE54.4软件工程任务
Agent Last Exam25.2通用 Agent 综合能力
Automation Bench (Public)25.1自动化任务

根据 DeepSeek 官方口径,这些成绩均远超 4 月上线的 V4-Pro-Preview。换句话说:一个主打性价比的 Flash 版本,在 Agent 能力上干翻了自家先发的旗舰 Pro 预览版。

测试条件也做了透明披露:公开基准集上的 Code Agent 任务使用 DeepSeek Harness 极简模式作为测试框架,max 档位,top_p=0.95、temperature=1.0。DSBench-FullStack 和 DSBench-Hard 是内部测试集。

—— 广告 ——

二、结构没变,变的是后训练

一个值得注意的细节:DeepSeek-V4-Flash-0731 的模型结构、尺寸与 V4-Flash-preview 完全一致,仅重新进行了后训练

模型本体还是那套 MoE 架构:总参数量 284B、激活参数 13B,支持最长 1M token 上下文、最大 384K 输出,思考模式与非思考模式可切换。底座没动,变的是"后天教育"。

这传递出一个信号:在 Agent 能力这条赛道上,后训练策略的优化空间还很大。同样的架构,经过更精细的后训练调优,就能在基准测试上产生质的飞跃。这也解释了为什么 DeepSeek 把正式版命名为"V4"而不是"V4.1"——基模没有换,换的是训练工艺。

顺带一提,V4 系列在长上下文效率上的底子很厚:官方此前公布的数据显示,100 万 token 场景下单 token 推理计算量仅为 V3.2 的 27%,KV Cache 占用降至约 10%。

三、工程适配:Responses API + Codex,冲着 Agent 生态来的

正式版 V4-Flash 在工程适配上有两个关键动作:

  1. 原生支持 OpenAI Responses API 格式——这是目前 Agent 产品圈最流行的接口形态,Flash 版是当前唯一支持该格式的 V4 模型(V4-Pro 预计 8 月初跟进)。
  2. 针对性适配 Codex——开发者无需修改 Base URL 即可切换模型,把 V4-Flash 直接接入现有 Codex 工作流。

加上预览版时期已经完成的 Claude Code、OpenClaw、OpenCode、CodeBuddy 等主流 Agent 产品的适配,V4-Flash 现在几乎覆盖了主流编程 Agent 的全家桶。配合官方即将发布的 DeepSeek Harness 极简模式评测框架(本次基准测试就是用它跑的),DeepSeek 在"模型 + 工具链 + 评测标准"三件套上正在形成闭环。

四、价格:仍是地板价,但引入了峰谷定价

先看官方价格(单位:元/百万 token):

计费项deepseek-v4-flashdeepseek-v4-pro
输入(缓存命中)0.020.025
输入(缓存未命中)13
输出26

输出 2 元/百万 token 是什么概念?对比一下闭源旗舰:GPT-5.5 输出 30 美元(约 210 元人民币),Claude Opus 4.8 是 25 美元(约 175 元)。V4-Flash 连它们的零头都不到,而且这还只是 Flash——能力更强的 Pro 输出也才 6 元。

需要留意的是峰谷定价即将生效:高峰时段(北京时间每日 9:00-12:00、14:00-18:00)所有计费项价格翻倍,具体生效时间以官方通知为准。对白天跑批量的开发者来说,这是一笔实打实的成本变化——但也给了你一个明确的省钱抓手:把非交互的批量任务挪到夜间跑,成本直接砍半。

顺带说明:旧的 deepseek-chat 和 deepseek-reasoner 模型 ID 已经退役,由 V4 系列的非思考/思考模式取代,API 接口完成了统一。

五、行业观察:竞争焦点从规模转向 Agent 能力

今天这个节点很微妙。就在 DeepSeek 发布 Flash 正式版的同一天,OpenAI 宣布 GPT-5.6 Luna 降价 80%,被业内解读为被国产大模型的低价策略倒逼。往前看一周,月之暗面开源了 2.8 万亿参数的 Kimi K3,字节、MiniMax 也接连发布新模型。

价格战打到今天,API 调用成本已经不再是开发者选模型的决定性因素——真正稀缺的是能交付的 Agent 能力。DeepSeek-V4-Flash 正式版的示范意义在于:低价不等于低能。一个 284B 总参数、13B 激活的"轻量"模型,靠后训练把 Agent 能力做到反超自家旗舰预览版,这才是对"参数越大越好"叙事最有力的反驳。

对开发者而言,现在的选择其实很清晰:

  • Agent 工作流重度用户(Codex、Claude Code 玩家):V4-Flash 正式版值得立刻试试,Responses API 原生支持意味着迁移成本几乎为零;
  • 成本敏感型应用(客服、批量文档处理、爬虫解析):0.02 元/百万 token 的缓存命中价格,配合夜间调用,成本可以压到极致;
  • 追求推理上限的场景:再等等,V4-Pro 正式版官方口径是"尽快发布",预计 8 月初。

结语

从 4 月预览版到今天的正式版,DeepSeek 用三个月证明了一件事:模型规模的军备竞赛之外,后训练和工程适配同样能把能力天花板顶上去。V4-Flash 正式版用 2 元/百万 token 的输出价格交出了一份反超自家 Pro 预览版的 Agent 成绩单——接下来就看 V4-Pro 正式版怎么接招了。

参考:DeepSeek 官方 API 价格文档IT之家报道智东西报道

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/ai/deepseek-v4-flash-ga