
DeepSeek-V4-Flash 正式版发布:Agent 能力反超自家 Pro 预览版,输出只要 2 元/百万 token
2026年7月31日,DeepSeek-V4-Flash 正式版 API 上线公测:9 项 Agent 基准全面反超 V4-Pro-Preview,原生支持 Responses API 并适配 Codex,输出价格仅 2 元/百万 token。
原创。DeepSeek-V4-Flash 正式版今天下午上线公测:Agent 能力大幅增强,9 项基准测试全面反超 Pro 预览版,原生支持 OpenAI Responses API 并适配 Codex,输出价格只要 2 元/百万 token。
2026 年 7 月 31 日下午,DeepSeek 通过官方 API 文档发布日志,宣布 DeepSeek-V4-Flash 正式版 API 上线公测,模型版本号为 DeepSeek-V4-Flash-0731。距离 4 月 24 日 V4 系列预览版发布,刚好过去了三个多月。
这条消息本身不算意外——6 月 29 日 DeepSeek 就通过邮件官宣 V4 正式版计划 7 月中旬上线,并同步引入「峰谷定价」机制。真正的意外在成绩单里:这次正式版把 Agent 能力拉到了一个离谱的位置,多项基准测试远超自家的 V4-Pro-Preview,用更便宜的价格交出了更强的干活能力。
一、9 项 Agent 基准:反超 Pro 预览版
官方一口气公布了 9 项 Agent 基准测试成绩,覆盖终端操作、代码仓库理解、网络安全对抗、端到端软件开发等场景:
| 基准测试 | 得分 | 考察内容 |
|---|---|---|
| Terminal Bench 2.1 | 82.7 | 终端环境下的任务执行能力 |
| Cybergym | 76.7 | 网络安全对抗 |
| Toolathlon verified | 70.3 | 工具调用 |
| DSBench-FullStack | 68.7 | 全栈开发(内部测试集) |
| DSBench-Hard | 59.6 | Coding Agent 难题(内部测试集) |
| NL2Repo | 54.2 | 自然语言生成代码仓库 |
| DeepSWE | 54.4 | 软件工程任务 |
| Agent Last Exam | 25.2 | 通用 Agent 综合能力 |
| Automation Bench (Public) | 25.1 | 自动化任务 |
根据 DeepSeek 官方口径,这些成绩均远超 4 月上线的 V4-Pro-Preview。换句话说:一个主打性价比的 Flash 版本,在 Agent 能力上干翻了自家先发的旗舰 Pro 预览版。
测试条件也做了透明披露:公开基准集上的 Code Agent 任务使用 DeepSeek Harness 极简模式作为测试框架,max 档位,top_p=0.95、temperature=1.0。DSBench-FullStack 和 DSBench-Hard 是内部测试集。
—— 广告 ——
二、结构没变,变的是后训练
一个值得注意的细节:DeepSeek-V4-Flash-0731 的模型结构、尺寸与 V4-Flash-preview 完全一致,仅重新进行了后训练。
模型本体还是那套 MoE 架构:总参数量 284B、激活参数 13B,支持最长 1M token 上下文、最大 384K 输出,思考模式与非思考模式可切换。底座没动,变的是"后天教育"。
这传递出一个信号:在 Agent 能力这条赛道上,后训练策略的优化空间还很大。同样的架构,经过更精细的后训练调优,就能在基准测试上产生质的飞跃。这也解释了为什么 DeepSeek 把正式版命名为"V4"而不是"V4.1"——基模没有换,换的是训练工艺。
顺带一提,V4 系列在长上下文效率上的底子很厚:官方此前公布的数据显示,100 万 token 场景下单 token 推理计算量仅为 V3.2 的 27%,KV Cache 占用降至约 10%。
三、工程适配:Responses API + Codex,冲着 Agent 生态来的
正式版 V4-Flash 在工程适配上有两个关键动作:
- 原生支持 OpenAI Responses API 格式——这是目前 Agent 产品圈最流行的接口形态,Flash 版是当前唯一支持该格式的 V4 模型(V4-Pro 预计 8 月初跟进)。
- 针对性适配 Codex——开发者无需修改 Base URL 即可切换模型,把 V4-Flash 直接接入现有 Codex 工作流。
加上预览版时期已经完成的 Claude Code、OpenClaw、OpenCode、CodeBuddy 等主流 Agent 产品的适配,V4-Flash 现在几乎覆盖了主流编程 Agent 的全家桶。配合官方即将发布的 DeepSeek Harness 极简模式评测框架(本次基准测试就是用它跑的),DeepSeek 在"模型 + 工具链 + 评测标准"三件套上正在形成闭环。
四、价格:仍是地板价,但引入了峰谷定价
先看官方价格(单位:元/百万 token):
| 计费项 | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| 输入(缓存命中) | 0.02 | 0.025 |
| 输入(缓存未命中) | 1 | 3 |
| 输出 | 2 | 6 |
输出 2 元/百万 token 是什么概念?对比一下闭源旗舰:GPT-5.5 输出 30 美元(约 210 元人民币),Claude Opus 4.8 是 25 美元(约 175 元)。V4-Flash 连它们的零头都不到,而且这还只是 Flash——能力更强的 Pro 输出也才 6 元。
需要留意的是峰谷定价即将生效:高峰时段(北京时间每日 9:00-12:00、14:00-18:00)所有计费项价格翻倍,具体生效时间以官方通知为准。对白天跑批量的开发者来说,这是一笔实打实的成本变化——但也给了你一个明确的省钱抓手:把非交互的批量任务挪到夜间跑,成本直接砍半。
顺带说明:旧的 deepseek-chat 和 deepseek-reasoner 模型 ID 已经退役,由 V4 系列的非思考/思考模式取代,API 接口完成了统一。
五、行业观察:竞争焦点从规模转向 Agent 能力
今天这个节点很微妙。就在 DeepSeek 发布 Flash 正式版的同一天,OpenAI 宣布 GPT-5.6 Luna 降价 80%,被业内解读为被国产大模型的低价策略倒逼。往前看一周,月之暗面开源了 2.8 万亿参数的 Kimi K3,字节、MiniMax 也接连发布新模型。
价格战打到今天,API 调用成本已经不再是开发者选模型的决定性因素——真正稀缺的是能交付的 Agent 能力。DeepSeek-V4-Flash 正式版的示范意义在于:低价不等于低能。一个 284B 总参数、13B 激活的"轻量"模型,靠后训练把 Agent 能力做到反超自家旗舰预览版,这才是对"参数越大越好"叙事最有力的反驳。
对开发者而言,现在的选择其实很清晰:
- Agent 工作流重度用户(Codex、Claude Code 玩家):V4-Flash 正式版值得立刻试试,Responses API 原生支持意味着迁移成本几乎为零;
- 成本敏感型应用(客服、批量文档处理、爬虫解析):0.02 元/百万 token 的缓存命中价格,配合夜间调用,成本可以压到极致;
- 追求推理上限的场景:再等等,V4-Pro 正式版官方口径是"尽快发布",预计 8 月初。
结语
从 4 月预览版到今天的正式版,DeepSeek 用三个月证明了一件事:模型规模的军备竞赛之外,后训练和工程适配同样能把能力天花板顶上去。V4-Flash 正式版用 2 元/百万 token 的输出价格交出了一份反超自家 Pro 预览版的 Agent 成绩单——接下来就看 V4-Pro 正式版怎么接招了。
© 2026 四月
原文链接:https://www.aprilzz.com/ai/deepseek-v4-flash-ga
相关文章
Claude Opus 4.8 正式发布:Anthropic 迄今最强模型,Agent 能力大幅提升
2026 年 5 月 28 日,Anthropic 发布 Claude Opus 4.8。新模型在编程、Agent、推理等全面超越前代,推出 Effort Control 和动态工作流功能,定价不变。
DeepSeek V4 预览版全面解读:1M 上下文、1.6T MoE、开源逼近闭源前沿
DeepSeek 于 2026 年 4 月 24 日正式发布 V4 预览版,包含 Pro 和 Flash 两个版本,以 1.6T 总参数、1M 上下文窗口、极低 API 定价冲击 AI 格局。本文基于官方技术报告与 HuggingFace 开源模型信息,全面解读其架构创新、性能表现与行业影响。
Anthropic 发布 Claude Opus 5:近 Fable 级别的智能,一半的价格
Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,全新旗舰模型在编码、科学研究和知识工作等多项基准上超越前代 Opus 4.8 近两倍性能,定价仅为 Fable 5 的一半