DeepSeek-V4-Flash-0731 正式发布:性能暴涨 6 倍?一文看懂它比预览版强在哪
摘要7 月 31 日DeepSeek 发布 V4-Flash-0731 正式版取代预览版。本文基于官方发布说明逐项计算对比了它在 9 个基准上相比 Flash 预览版、V4-Pro 预览版以及闭源模型 Opus-4.8 的提升幅度——DeepSWE 提升 645%、Cybergym 几乎翻倍、9 项基准全部反超 V4-Pro。不涉及部署教程纯性能解读。7 月 31 日DeepSeek 正式发布了DeepSeek-V4-Flash-0731取代此前的预览版本。官方宣称其智能体Agentic能力大幅增强并且在大多数公开基准上全面超越了参数量远大于它的 DeepSeek-V4-Pro预览版。官方公告里的数字都是干巴巴的分数很多人看完只知道变强了但不知道强了多少。本文基于官方发布说明整理逐项算出提升幅度只聚焦一个核心问题它到底比之前强了多少数据来源DeepSeek-V4-Flash-0731 官方发布说明Hugging Face一、一句话结论在所有 9 个基准上0731 正式版相比 Flash 预览版全部大幅提升平均提升超过 20 个百分点与 V4-Pro预览版相比9 项基准全部领先与最强的闭源模型 Opus-4.8 相比多数任务差距已缩小到个位数百分点以内。二、先看懂这些英文指标每个测什么表里的分数背后是九个测法完全不同的基准先搞清楚每个在测什么数字才有意义指标测什么说明Terminal Bench 2.1终端环境里的真实任务89 个任务覆盖软件工程、系统管理、数据处理、模型训练、安全等领域在容器终端环境中完成如调试异步代码、修复安全漏洞用程序化测试验证结果NL2Repo从自然语言生成完整代码仓库即 NL2Repo-BencharXiv:2512.12730只给一份自然语言需求文档和一个空工作区智能体要自主设计架构、管理依赖、实现多模块逻辑产出一个可安装的完整 Python 库目前最强智能体平均测试通过率也不到 40%Cybergym网络安全漏洞利用ICLR 2026 论文基准见官网 github.com/sunblaze-ucb/cybergym1507 个实例源自 188 个真实开源项目的已修复漏洞多数来自 OSS-Fuzz智能体拿到漏洞描述和未打补丁的代码库需写出能复现漏洞的 PoC概念验证代码并通过验证DeepSWE深度软件工程arXiv:2607.07946113 个原创长时程软件工程任务覆盖 91 个活跃开源仓库、5 种语言。任务从零编写、不回灌上游规避了 SWE-bench 类基准训练数据泄漏问题用人工编写的验证器判定不依赖随修复提交的测试Toolathlon-Verified多应用工具调用ICLR 2026arXiv:2510.2572632 个真实软件应用、604 个工具多来自 MCP 服务器、108 个任务平均约 20 轮交互才能完成每任务用确定性脚本严格验证Verified 为当前最终版Agents’ Last Exam专家级知识 工具链Scale AI 出品的智能体版终极考试横跨多学科的专家级难题要求智能体通过搜索、工具、推理综合作答AutomationBench Public跨应用流程自动化arXiv:2604.18934基于 Zapier 真实工作流模式任务横跨销售、市场、运营、支持、财务、HR要求智能体自行发现 API 端点、遵守策略文档、跨应用编排如 CRM邮箱日历只按最终落库状态程序化判定目前最强前沿模型得分也不到 10%DSBench-FullStack †内部 · 全栈开发DeepSeek 内部测试集从需求到前后端完整落地的全栈开发任务DSBench-Hard †内部 · 高难度编程DeepSeek 内部测试集面向智能体的高难度编程问题两个提醒可复现性不同Terminal Bench 2.1、Toolathlon、Cybergym、Agents’ Last Exam、AutomationBench 等为公开基准DSBench 两项为 DeepSeek 内部集其分数不可与其他家的公开数字直接横向比较难度差异大Cybergym 76.7 分和 AutomationBench 25.1 分不代表前者更容易——这些基准的任务形态、验证严格程度完全不同看趋势比看绝对值更靠谱三、相比 Flash 预览版全面且大幅的跨越基准0731 正式版Flash 预览版提升百分点相对提升Terminal Bench 2.182.761.820.934%NL2Repo54.239.414.838%Cybergym76.738.738.098%DeepSWE54.47.347.1645%Toolathlon-Verified70.349.720.641%Agents’ Last Exam25.215.89.460%AutomationBench Public25.110.814.3132%DSBench-FullStack †68.737.031.786%DSBench-Hard †59.625.833.8131%† DSBench-FullStack 为内部全栈开发测试集DSBench-Hard 为内部高难度编程智能体测试集。几个关键观察没有一项基准原地踏步——最小的提升Agents’ Last Exam也有 9.4 个百分点编程智能体是提升最大的领域DeepSWE 从 7.3 直接冲到 54.4提升 645%AutomationBench 翻了一倍多Cybergym 几乎翻倍这意味着预览版到正式版之间模型在长链路工具调用、代码仓库操作、终端命令执行等智能体核心能力上发生了质变而不是简单的微调式改进。四、相比 V4-Pro预览版以小博大更值得注意的是Flash 正式版的激活参数量远小于 V4-Pro却在所有基准上反超基准V4-Flash-0731V4-Pro (预览)领先百分点Terminal Bench 2.182.772.110.6NL2Repo54.238.515.7Cybergym76.752.724.0DeepSWE54.412.841.6Toolathlon-Verified70.355.914.4Agents’ Last Exam25.216.58.7AutomationBench Public25.112.812.3DSBench-FullStack †68.741.826.9DSBench-Hard †59.631.128.5尤其 DeepSWE 领先41.6 个百分点、Cybergym 领先 24 个百分点——在小而强这件事上0731 正式版几乎是在用更小的模型教大模型做事。这背后离不开它附带的DSpark 投机解码模块以草稿模型加速生成让小参数 高推理效率成为可能。五、与闭源最强模型 Opus-4.8 的差距已相当接近基准V4-Flash-0731Opus-4.8差距Terminal Bench 2.182.785.0-2.3NL2Repo54.269.7-15.5Cybergym76.783.1-6.4DeepSWE54.458.0-3.6Toolathlon-Verified70.376.2-5.9Agents’ Last Exam25.225.7-0.5AutomationBench Public25.127.2-2.1DSBench-FullStack †68.771.6-2.9DSBench-Hard †59.671.7-12.19 项基准中7 项差距在 6.4 个百分点以内其中 Agents’ Last Exam 仅差 0.5 分、AutomationBench 差 2.1 分。唯一差距明显的 NL2Repo-15.5和 DSBench-Hard-12.1集中在从自然语言直接生成完整仓库和高难度编程问题这类任务上——这说明通用智能体能力已经追平但极限编程深度仍是下一阶段的攻坚方向。六、性能数字是怎么来的要正确解读上述数据需要注意评估条件官方说明公开基准的 Code Agent 任务使用即将发布的 DeepSeek Harness 最小模式minimal mode作为智能体框架采样参数为temperature 1.0、top_p 0.95并使用推理努力reasoning_effort等级low/high/max控制模型作答前的思考量DSBench 两项为内部测试集非公开复现基准。因此表中数字反映的是在官方 Harness 框架下的上限表现不同智能体框架下的实际效果会有浮动。七、结语如果用一句话总结 DeepSeek-V4-Flash-0731 的性能提升它对预览版是一次跨代升级对 Pro 版本是一次以小博大对闭源最强模型则是一次贴身紧逼。三个维度放在一起Flash 正式版已经用数据证明——智能体能力与推理效率的结合正在成为比单纯堆参数更重要的竞争维度。接下来我会继续关注它的实际部署体验和第三方复测数据也欢迎大家在评论区分享自己的实测结果。参考链接DeepSeek-V4-Flash-0731 官方发布说明https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731Terminal-Bench 2.1官网 / 数据集https://www.tbench.ai/ · https://github.com/harbor-framework/terminal-bench-2-1NL2Repo-Bench论文https://arxiv.org/abs/2512.12730Cybergym官网 / 论文https://github.com/sunblaze-ucb/cybergymDeepSWE论文 / 官网https://arxiv.org/abs/2607.07946 · https://deepswe.datacurve.ai/Toolathlon论文 / 仓库https://arxiv.org/abs/2510.25726 · https://github.com/hkust-nlp/toolathlonAutomationBench论文https://arxiv.org/abs/2604.18934数据整理基于 DeepSeek 官方发布说明数据版权归 DeepSeek-AI 所有MIT License 允许转载转载注明出处即可。

相关新闻