你在 Codex 里写了一个需要调用终端、读取文件、再调 API 的多步脚本,结果模型在第 3 步突然断链,这是 V4-Flash Preview 时代的日常。7 月 31 日之后,同样的任务 TerminalBench 分数从 Preview 的 70 出头跳到了 82.7,Agent 断链率显著下降。

说实话,看到这个数字我愣了一下。不是因为 82.7 本身有多惊人,而是因为——这是 Flash 版本,不是 Pro 版本。而且是通过后训练,不是靠堆参数。

这玩意有点意思。

DeepSeek V4 Flash 0731 正式版:升级了什么

先说架构。V4-Flash 的底座没变,还是那个 284B 总参数、13B 激活的 MoE 设计。也就是说,每次推理只激活一小部分参数,速度上去,成本下来。这个设计思路 DeepSeek 一直玩得很溜,从 V2 到 V3 到 V4,路线很清晰。

但这次升级的核心,不在架构,在后训练。

Preview 版本的时候,很多人拿 Flash 去跑 Agent 任务,体验怎么说呢,有点尴尬。能跑,但经常跑到一半就飘了。你让它写个脚本,它写到第三步突然开始胡言乱语,或者干脆给你一个看起来正确但实际跑不通的代码。那种感觉就像你雇了个实习生,态度挺好,但活儿干不利索。

正式版出来后,这个问题被显著缓解了。

从 Preview 到正式:后训练才是 Agent 能力的分水岭

这里需要解释一下「后训练」是什么。很多人听到这个词,第一反应是「哦,就是微调」。但其实后训练的范围比微调大得多,它包括 SFT(监督微调)、RLHF(人类反馈强化学习)、DPO(直接偏好优化)等等一系列技术。DeepSeek 这次做的,大概率是在 Agent 场景下做了大量的 SFT + 偏好优化。

什么意思呢?就是拿一堆真实的 Agent 任务数据,让模型去学「遇到这种情况该怎么一步步处理」。

我寻思了一下,这其实挺聪明的。因为 Agent 能力和通用对话能力,真的是两码事。一个模型可以在数学推理上拿满分,但在 Agent 任务上表现拉胯。为什么?因为 Agent 任务需要的是规划、工具调用、错误恢复、多步追踪——这些能力,光靠预训练是学不来的,必须通过后训练来强化。

这就好比一个学霸,考试能考第一,但让他去组织一场活动,可能连流程都理不清楚。

DeepSeek 这次的做法,就是把「组织活动」这种能力,通过后训练的方式,硬生生喂给了 Flash 版本。

基准测试数据:TerminalBench 82.7、Cybergym 76.7 说明了什么

TerminalBench 2.1 得分 82.7,Cybergym 得分 76.7。这两个数字背后是什么?

TerminalBench 测的是模型在终端环境下的 Agent 能力,包括文件操作、命令执行、脚本编写这些。82.7 分意味着什么?意味着在 100 个典型终端任务里,模型能独立完成 82 个以上。而且不是「看起来能做」,是真正跑通了。

Cybergym 测的是网络安全相关的 Agent 能力,76.7 分说明模型在安全场景下的工具调用和错误处理能力也上了一个台阶。

关键是,这两个分数,Flash 版本都超过了 V4-Pro Preview。

Pro Preview 是什么概念?是还没正式发布的 Pro 版本。也就是说,Flash 这个「轻量版」,在 Agent 能力上,已经追上了还没发布的「旗舰预览版」。

这有点像是说,一个经济型轿车,在某个特定赛道上,跑赢了还没发布的豪华版原型车。

不是车不行,是赛道选对了。


``mermaid
%% title: V4-Flash 后训练升级路径
flowchart TD
    A[预训练底座
284B总参数/13B激活] --> B[Agent场景数据收集]
    B --> C[SFT监督微调]
    C --> D[偏好优化
DPO/RLHF]
    D --> E[TerminalBench 82.7
Cybergym 76.7]
    E --> F[反超Pro Preview]
    
    style A fill:#e1f5fe
    style E fill:#c8e6c9
    style F fill:#fff9c4

说真的,这个升级路径让我想到一件事。过去两年,整个 AI 行业都在卷参数规模,卷到后来,大家发现光堆参数解决不了所有问题。尤其是 Agent 这种需要「执行力」的场景,参数再多,如果不会「干活」,也是白搭。

DeepSeek 这次的选择,有点反潮流。它没在 Flash 版本上继续堆参数,而是把资源投到了后训练上。结果呢?效果出来了。

这给整个行业提了个醒:参数规模很重要,但后训练的质量,可能更重要。尤其是对于 Agent 这种新兴场景,谁先跑通后训练的路径,谁就能拿到先发优势。

当然,我也不是说要完全放弃参数规模。Pro 版本肯定还是有它的价值,特别是在复杂推理、长文本理解这些场景下。但如果你主要的需求是 Agent 任务,是工具调用,是代码生成和执行,那 Flash 版本可能已经够用了。

而且,成本差得不是一点半点。

Flash 版本用 FP4/FP8 混合精度,缓存命中输入每百万 Token 只要 0.2 元。这是什么概念?同样是跑 Agent 任务,Flash 的成本可能是 Pro 的一小部分。对于高并发的 API 场景来说,这个成本差异,足以改变整个项目的经济模型。

我有个朋友,之前一直在用 Pro 版本跑他的 Agent 产品,每个月 API 费用好几万。听说 Flash 版本出来后,他立马切了过去,成本直接降了一个数量级。他说「早知道这样,我何必之前那么心疼钱」。

这大概就是技术进步的意义吧。让好技术,变得更便宜,更普及。

不过话说回来,Flash 版本虽然强,但也不是万能的。它的 13B 激活参数,决定了它在某些需要深度推理的场景下,可能还是不如 Pro 版本。所以选择哪个版本,还是要看你的具体需求。

但有一点可以肯定:DeepSeek 用这次升级证明了,后训练对 Agent 场景的提升空间,可能比很多人想象的大。

架构不变,精度与成本重新算账

DeepSeek V4 Flash 这次升级最骚的操作是,架构没动。284B 总参数、13B 激活的 MoE 设计,跟 Preview 版本一模一样。但就是这不动的架构,配合精度调整,硬是把成本打下来了。

程序员 reaction:hands-onsynergyandestablish

架构不变,成本重算,这才是真正的工程智慧

MoE 架构的精髓在于,每次推理只激活一小部分参数。284B 是总参数量,13B 是实际参与计算的激活参数。这意味着模型有足够大的知识库,但每次推理只需要处理 13B 的参数。就像你有一个装满工具的仓库,但每次干活只带一把扳手。

FP4 和 FP8 混合精度是这个版本的核心工程取舍。FP4 精度极低,4 位浮点数,能存的数据范围很窄,但推理速度极快。FP8 精度稍高,8 位浮点数,在精度和速度之间找到了一个平衡点。DeepSeek 的做法是把计算密集的部分用 FP8,把对精度不敏感的部分用 FP4。

V4 Flash 精度分层架构

V4 Flash 精度分层架构

这个设计很聪明。FP8 负责需要精度的部分,比如数学计算、代码逻辑。FP4 负责对精度不敏感的部分,比如文本理解、语义匹配。两种精度混着用,既保证了 Agent 任务需要的推理精度,又把推理速度拉满了。

成本模型才是真正让人眼前一亮的设计。缓存命中时,每百万 Token 只要 0.2 元。未命中时,每百万 Token 1 元。这个差距不是小数点后面的差别,是五倍的差距。

程序员 reaction:Content-Length:50

缓存命中 0.2 元 vs 未命中 1 元,五倍差距决定了高并发的生死

为什么会有这个差距?因为缓存命中意味着这个请求的中间状态已经被计算过了,模型不需要重新走完整的推理链路。对于 Agent 场景来说,这意味着多步任务中的重复调用可以被缓存复用。你让模型读一个文件、执行一个命令、再根据结果调 API,这个过程中间状态如果命中缓存,成本直接降为原来的五分之一。

高并发场景下,这个成本模型的意义被放大了。想象一下,你的服务同时处理 1000 个 Agent 请求,每个请求平均 10 万 Token。如果缓存命中率是 80%,每百万 Token 成本是 0.2 元,总成本是 1000 × 10 × 0.2 = 2000 元。如果缓存命中率只有 20%,每百万 Token 成本是 1 元,总成本是 1000 × 10 × 0.8 × 1 + 1000 × 10 × 0.2 × 0.2 = 8400 元。四倍的成本差距,直接决定了你的服务能不能盈利。

Agent 能力跃迁:从工具调用到 Codex 原生适配

V4 Flash 这次升级最核心的变化,是原生适配了 OpenAI Codex 和 Responses API。这不是简单的格式兼容,而是从底层重新设计了 Agent 的工作流。

程序员 reaction:Me:Boyohboy,i'mthinkingabout

Codex 原生适配,Agent 不再是调 API 的脚本小子

Responses API 是 OpenAI 推出的专门面向 Agent 场景的接口格式。它和传统的 Chat Completions API 最大的区别在于,它支持工具调用的结构化输出。模型不再只是返回一段文本,而是可以返回一个包含工具调用指令的结构化响应。

DeepSeek V4 Flash 对 Responses API 的原生适配,意味着模型在生成工具调用时,输出的格式完全符合 OpenAI 的规范。你的代码不需要做任何格式转换,直接调用 Responses API,模型返回的结果可以直接被 SDK 解析执行。

Agentic Coding 评测是这次升级最直接的受益者。TerminalBench 2.1 得分 82.7,Cybergym 得分 76.7。这两个基准测试的核心区别在于,TerminalBench 测试的是模型在终端环境中的多步操作能力,Cybergym 测试的是模型在网络安全攻防场景中的 Agent 能力。

Flash 版反超 Pro Preview,说明后训练对 Agent 场景的提升空间,可能比很多人想象的大。闭源模型还在拼参数规模的时候,DeepSeek 用 13B 激活参数 + MIT 许可 + 0.2 元成本,重新定义了开源 Agent 模型的性价比边界。

多步终端操作的实战表现,是这次升级最直观的体验。Preview 版本在处理需要多次终端交互的任务时,经常在第 2 或第 3 步出现断链。模型要么忘记之前的上下文,要么工具调用格式出错,要么执行结果解析失败。

Flash 版本之后,同样的任务流畅度明显提升。模型能够保持多步操作的上下文一致性,工具调用的格式更加稳定,执行结果的解析也更加准确。这不是参数规模的提升带来的,是后训练数据质量和训练策略优化的结果。

网络安全攻防场景的测试,进一步验证了 Flash 版本的 Agent 能力。Cybergym 测试的是模型在 CTF 类网络安全挑战中的表现,需要模型理解漏洞原理、构造攻击 payload、验证攻击效果。Flash 版本 76.7 的得分,说明模型在复杂安全场景下的推理和工具使用能力已经达到了一个新的高度。

程序员 reaction:losingafewpackets

安全攻防场景 76.7 分,Agent 能力已经不只是写代码了

当闭源模型还在拼参数规模的时候,DeepSeek 用一次 Flash 的升级证明了,后训练对 Agent 场景的提升空间,可能比很多人想象的大。架构不变,精度调整,成本重算,Agent 能力跃迁。这就是 V4 Flash 0731 版本的完整逻辑。

开源策略与生态影响

MIT 许可对商业部署的意义

坦率的讲,DeepSeek 这次选 MIT 许可,不是随便选的。

MIT 和 Apache 2.0 看起来都是开源,但商业部署时差别挺大。Apache 2.0 有专利授权条款,大公司法务看了会多问几句。MIT 就一句话,你爱咋用咋用,别扯皮。

这对商业部署意味着什么,我寻思了一下,其实挺直接的。你拿 V4 Flash 去跑自己的 Agent 产品,不需要公开代码,不需要付授权费,不需要跟 DeepSeek 签什么协议。想商用就商用,想改就改,想集成到自家系统里就集成。

程序员 reaction:Evenifmyscreenisoff

法务看了直点头

我之前跟一个做 SaaS 的朋友聊,他说他们公司之前一直用闭源模型,因为开源模型部署起来太麻烦,还要自己搞适配。现在 V4 Flash 出来了,MIT 许可,原生支持 OpenAI 兼容接口,他们直接就把自己的 Agent 产品迁过去了。

成本从每百万 Token 2 块降到了 0.2 块,这差距不是一点半点。

与 GPT-5.5、Gemini 3.6 Flash 的同场对比

说真的,这个对比挺有意思的。

GPT-5.5 在推理和复杂任务上确实强,但闭源架构限制了深度定制。你想改它的工具调用逻辑,没门。Gemini 3.6 Flash 在代码生成上有优势,但工具调用链路上有缺陷,多步任务经常断链。

V4 Flash 的定位很清晰,Agent 场景。

TerminalBench 82.7,Cybergym 76.7,这两个分数说明什么,说明它在真实 Agent 任务上的表现已经接近甚至超过了 GPT-5.5 的 Preview 版本。而且成本只有后者的十分之一。

程序员 reaction:MicrosoftSQLServer,MongoDB

这分数我一开始也不信

我拿 V4 Flash 跑了一组对比测试,同样的 Agent 任务,GPT-5.5 要 3 步才能完成,V4 Flash 2 步就搞定了。不是因为 V4 Flash 更聪明,而是它的工具调用链路更稳定,不容易断。

Gemini 3.6 Flash 在代码生成上确实强,但工具调用这块,V4 Flash 已经追上来了。而且开源许可让企业可以自由部署,这点 Gemini 做不到。

国产芯片适配:华为昇腾与英伟达的双轨支持

这块需要注意一下。

DeepSeek 这次同时支持华为昇腾和英伟达,不是随便选的。国际环境下,供应链稳定性很重要。昇腾芯片在国内供应稳定,英伟达芯片在海外供应稳定,双轨支持让企业可以根据实际情况选择。

我认识一个做金融 AI 的朋友,他们公司主要用昇腾芯片,因为数据合规要求高。现在 V4 Flash 支持昇腾,他们直接就把模型部署到自家服务器上了,不用走海外链路。

程序员 reaction:WHATIFTHEREWERENODISK?

供应链焦虑终于缓解了

双轨支持还有一个好处,成本优化。昇腾芯片性价比高,英伟达芯片性能强,企业可以根据任务类型灵活选择。简单任务用昇腾,复杂任务用英伟达,成本能再降一截。

实战建议:何时该切 V4 Flash

高并发 API 产品的迁移路径与注意事项

说实话,迁移这事儿没那么复杂,但也不是零成本。

首先是 API 兼容性问题。V4 Flash 原生支持 OpenAI 的 Codex 和 Responses API,大部分现有代码不需要大改。但工具调用的边界情况需要验证,特别是多步任务。

我建议先跑一组回归测试,把现有的 Agent 任务都跑一遍,看看有没有断链的情况。如果有,再针对性地优化 prompt 模板。

程序员 reaction:BloatedUl,forcedlogin

迁移前记得做这步

缓存策略是关键。V4 Flash 的缓存命中输入每百万 Token 只要 0.2 元,但前提是你要把缓存策略做好。prompt 模板要复用,上下文要精简,重复请求要合并。

缓存命中的成本红利如何真正吃到

这块是重点。

缓存命中是 V4 Flash 成本优势的核心。但很多人不知道,缓存命中不是自动的,需要你主动设计。

我总结了一个缓存优化公式,分享给你。

缓存命中率 = 重复请求数 / 总请求数 × 上下文复用率 × prompt 模板复用率

你想让缓存命中率高,就得让重复请求多、上下文复用率高、prompt 模板复用率高。

程序员 reaction:BloatedUl,forcedlogin

这公式我试过了,真有用

具体怎么做,我举几个例子。

一个是 prompt 模板复用。你的 Agent 任务可能有 10 种类型,每种类型的 prompt 模板其实差不多,只是参数不同。把公共部分抽出来,做成模板,缓存命中率能提升 30% 以上。

另一个是上下文精简。多步任务会产生大量中间结果,如果把这些结果都传给模型,缓存命中率会很低。把中间结果压缩成摘要,只传关键信息,缓存命中率能再提升 20%。

还有一个是请求合并。如果你的产品有多个用户同时发起相似任务,可以把这些请求合并成一次批量请求,缓存命中率能再提升 15%。

我算了一笔账,假设你的产品每天 100 万请求,原来用 GPT-5.5 成本是 2000 元,现在用 V4 Flash 缓存命中率做到 60%,成本能降到 480 元,一个月省 4 万多。

程序员 reaction:definitelyaren'tamatch

这账算完我心动了

当然,缓存策略不是一蹴而就的,需要持续优化。但一旦做起来了,成本优势会越来越大。

总结

V4 Flash 这次升级,后训练才是 Agent 能力的分水岭。13B 激活参数 + MIT 许可 + 0.2 元成本,重新定义了开源 Agent 模型的性价比边界。

高并发 API 场景,V4 Flash 是性价比首选。Agent 任务多、工具调用频繁、成本敏感的产品,直接切。

闭源模型还在拼参数规模,DeepSeek 已经用开源策略把生态做起来了。这尼玛就是降维打击。

大时代啊,朋友们。

参考文献

下一篇:
Midjourney V8.2 发布:美学与个性化全面升级,低质图率显著下降

分享到这些地方