DeepSeek V4-Flash 0731 基准测试解读Agent 能力跃升与横向对比1. 更新概述DeepSeek V4-Flash 0731 正式版发布大幅增强了 Agent 能力。模型架构和尺寸不变仍是 284B 总参数、13B 激活参数这次只做了后训练post-training。9 项基准测试全部上涨涨幅远超小版本修修补补的幅度。2. 纵向对比与自己比把所有旧版本和当前版本的成绩放在一起对比9 项测试全部上涨。基准测试旧版本V4-Flash 0731涨幅DeepSWE7.354.447.1CyberGym——38DSBench-Hard——33.8DSBench-FullStack——31.7Terminal-Bench 2.161.882.720.9涨幅最大的三项DeepSWE 增加 47.1 分CyberGym 增加 38 分DSBench-Hard 增加 33.8 分。Terminal-Bench 2.1 从 61.8 涨到 82.7增加 20.9 分。核心结论DeepSeek 没有靠堆一个更大的底座交成绩。它把训练重点压到了 Agent 执行、工具调用和长任务上。3. 横向对比与同期最强模型比对比对象包括 GPT-5.6 Sol、Claude Opus 5、Kimi K3、GLM-5.2、MiniMax M3。以下选取 5 个重合度最高的 Agent 基准。Terminal-Bench 2.1模型分数GPT-5.6 Sol领先 5-6 分Kimi K3领先 5-6 分V4-Flash 073182.7GPT-5.6 Sol 和 Kimi K3 仍领先 V4-Flash 5-6 分。DeepSWE模型分数差距GPT-5.6 Sol18.6Claude Opus 514.4Kimi K313.1V4-Flash 073154.4这是差距最大的一个基准V4-Flash 在这个维度上还有明显追赶空间。Toolathlon-Verified模型分数Claude Opus 580.6Kimi K376.5V4-Flash 073170.3GLM-5.2低于 70.3V4-Flash 的 70.3 已超过 GLM-5.2距离 Kimi K3 只差 6.2 分。Agents’ Last Exam 和 AutomationBench在这两个基准上V4-Flash 紧咬第一梯队但尚未拿到第一。基准结论Agents’ Last Exam紧咬第一梯队AutomationBench紧咬第一梯队核心结论V4-Flash 已经进入第一梯队的讨论范围但还没有把最强的几个模型干下去。最难的长链条工程任务GPT-5.6 Sol、Opus 5 和 Kimi K3 依然首选。4. 性价比分析能力大涨价格一分没涨。价格维度V4-Flash 0731GPT-5.6 Luna差距缓存未命中输入0.14 美元0.20 美元便宜 30%缓存命中输入0.0028 美元0.02 美元便宜 86%输出0.28 美元1.20 美元便宜 77%约 1/4.3单位每百万 token。核心结论大批量跑代码检查、仓库分析、工具调用和 sub-agentV4-Flash 开始变得非常有吸引力。5. 选型建议场景推荐模型最难的长链条工程任务GPT-5.6 Sol / Claude Opus 5 / Kimi K3大批量代码检查、仓库分析、工具调用V4-Flash 0731关注性价比的场景V4-Flash 0731 为首选等待最终版本DeepSeek V4-Pro 正式版6. 总结V4-Flash 0731 通过后训练而非增大底座实现 Agent 能力大幅跃升9 项测试全部上涨已进入第一梯队讨论范围但尚未登顶价格优势明显大批量场景性价比突出最难的长链条工程任务第一梯队模型依然首选大批量跑代码检查、工具调用V4-Flash 极具吸引力