Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 在 Agent Arena 排名第 5(+11.23%),中位任务成本 $0.56,并重塑了 Pare…

一、Agent Arena 前五里,谁是真正的性价比之王

1.1 榜单变化:GPT-6.1 Sol 的 +11.23% 意味着什么

Agent Arena 的排名机制是 pairwise comparison。每次评估随机抽取两个模型,让同一 prompt 各生成一次回答,再由标注员盲评哪个更好。胜者获得 ELO 积分,排名据此动态更新。

+11.23% 是这个模型相对于其基准版本(GPT-6 Sol)的净提升幅度。换句话说,在同一 prompt 集合上,Sol 赢下的对决比例比旧版高了 11.23 个百分点。

这个数字放在 Agent Arena 这个赛道里不算小。上一次 Sol 进入榜单时,排名是 #6,这次直接翻了一个身位。更值得注意的事是它绕过了一个长期现象:Agent 类任务的头部位置向来被 Claude Opus 5 和 GPT-6 Astra 霸占,前者每任务成本在 $18–23 区间,后者更是 $9.44 起步。

Sol 以 $0.56 的中位任务成本杀入前五,且与 Astra 的分数差距不到 2 个百分点,这是 Agent Arena 历史上首次有非旗舰价模型做到这一点。

被追着问 BUG 修完了吗时的程序员表情

Agent跑满一圈回来成本已经超预算了

1.2 成本曲线重塑:$0.56 中位任务成本背后的数学

$0.56 是中位数,不是上限。Agent 任务的 token 消耗差异极大,简单问答可能不到 1,000 tokens,而 Computer Use 场景动辄几十万 tokens。Sol 的 API 定价是输入 2 美元/百万 Token、输出 10 美元/百万 Token,缓存读取只要 0.10 美元,比标准输入便宜 95%。

这对 Agent 场景的意义是直接的:Computer Use 的典型工作流是观察→思考→操作→再观察,每次循环都会重复读取屏幕截图或页面内容。缓存读取的 0.10 美元单价,意味着同一个页面的多次读取成本几乎可以忽略不计。

基准测试的数据也能佐证这一点。

在 DeepSWE v1.1 编码基准上,Sol 在中推理强度下达到 73.0% 的成绩,而旧版 Sol 要到 Max 强度才拿到 68.8%,且成本是前者的约 4 倍($2.74 vs $0.65)。官方称之为「以更低的推理强度和成本,比 GPT-6 Sol 最佳成绩高出 6.4 个百分点」。这 6.4 个百分点的本质,是循环架构减少了无效推理步数——模型在中间步骤就能判断方向是否正确,而不是在末端才发现问题。

在 OSWorld 2.0 电脑操作基准上,Sol 在 Max 强度下得分 71.4%,比旧版 Sol 的 64.4% 提升了 7 个百分点,而任务成本从 $3.37 降到 $1.27。对比 Astra 的 73.5% 得分和 $9.44 成本,差距不到 2 个百分点,但价格是 Astra 的七分之一。

``mermaid

Agent 任务成本结构对比

Agent 任务成本结构对比

OpenAI 还给出了一个关键细节:在低推理强度下,Sol 的事实性错误率从 11.4% 降至 7.7%,降幅 32%。这说明循环架构不仅加速了正确路径的收敛,也减少了无效路径的资源浪费。

成本曲线的重塑,本质上是架构层面的重新平衡。循环模型的核心设计是让 Agent 在每一步都能做自我校验,而不是在整条推理链完成后才发现方向错误。这直接压缩了无效 token 的消耗——而 token 消耗就是成本。

更狠的是,每年能省下一个亿。

这个数值背后的工程取舍,比排名本身更值得拆解。

三、循环模型架构:低成本高效执行的技术底座

3.1 为什么 Sol 能比 Astra 便宜却差不多强

价格剪刀差来自架构上的取舍。GPT-6.1 Sol 并不追求在原始算力上硬拼,而是将「推理强度」做成了可调节的旋钮。在 DeepSWE v1.1 编码基准中,旧版 GPT-6 Sol 开启 Max 模式需花费 $2.74 才能达到 68.8% 的通过率;GPT-6.1 Sol 仅需 $0.65 即可拿下 75.2%,反超前代 6.4 个百分点。同样的逻辑在 OSWorld 2.0 上更为直观:Sol (Max) 得分 71.4%,仅落后 Astra (Max) 的 73.5% 约 2 个百分点,但单次任务成本从 $9.44 骤降至 $1.27,降幅超八倍。

这意味着 Sol 的定位非常清晰:它不追求在每一道压轴题上拿满分,而是在工程高频场景里把「够用」的成本打穿。对于占预算大头的大部分常规 Agent 任务而言,这 2 个百分点的边际差距几乎可以忽略不计。

3.2 CoT 精准控制与后台自我纠错的机制差异

这种成本表现背后,是循环模型(Recurrence)架构在起作用。与传统一次生成式输出不同,Sol 在底层引入了更多可控的循环步数。开发者可通过调整推理强度,让模型在生成代码或执行命令时,主动回溯并校验中间步骤,而不是盲目推演到最后。

GPT-6.1 Sol 循环纠错机制

GPT-6.1 Sol 循环纠错机制

这套机制的关键在于「可控」。旧架构往往把思考过程藏进黑盒,算力烧完才知道结果;Sol 则将思考变成了一种可中断、可重写的资源。如果中间步骤判定失败,模型会优先尝试修正路径,而不是直接抛出一个看似合理实则错误的答案。

3.3 缓存读取 $0.10/百万 token 的工程价值

真正让 Sol 在 Agent 落地时拉开与其他模型差距的,是 $0.10/百万 token 的缓存读取定价。

Agent 的工作负载有一个显著特征:上下文窗口中往往有 70% 以上都是固定前缀——系统提示词、工具定义、历史会话记录。在 Computer Use 或代码生成场景下,这些重复内容每次调用都会被重新计费。按照标准价格 $2.00 计算,这些前缀几乎是在白烧钱;而缓存开启后,读取成本直接掉到 $0.10,降幅达 95%。

当单任务成本因为缓存被稀释到几毛钱,原本因为贵而不敢随意调用的重试机制、并行分支才真正具备了工程上的可行性。对于要把 Agent 塞进生产环境的工程师而言,Sol 这套「高命中率 + 可编辑循环 + 廉价缓存」的组合,才是让模型真正下地的技术底座。

四、选型决策:谁该用 Sol,谁还得追 Astra

4.1 Agent 应用场景的成本敏感度分层

选模型前先问一个问题:这个场景每多花 1 美元成本,能换回多少额外价值?

GPT-6.1 Sol 的 API 标准价为输入 $2/百万 token、输出 $10/百万 token,缓存读取仅 $0.10/百万 token。GPT-6 Astra 的对应价格为 $10 和 $50。Sol 是 Astra 的五分之一,这个差价不是线性缩小,而是跨了一个数量级。

三个典型场景,选型逻辑完全不同。

第一类:批量处理、内部工具、可重试的后台流程。 代码审查流水线、数据清洗脚本生成、日志分析摘要——这类任务的失败成本远低于执行成本。Sol 的中位任务成本 $0.56 意味着每天跑十万次任务只需 $56。如果换用 Astra,同样的量级会变成 $280/天,而性能收益可能只体现在少数边界 case 上。

这里 cache read 的 $0.10/百万 token 直接决定了上限——重复请求同一份系统文档时,缓存命中的边际成本几乎为零。

第二类:用户可见、一次写对的对话型 Agent。 客服机器人、技术文档问答、代码审查助手。用户的耐心阈值在这里直接转化为留存率。Sol 与 Astra 在 OSWorld 2.0 上相差 2.1 个百分点(71.4% vs 73.5%),看起来不大,但在真实用户反馈里,那 2% 可能就是「能用」和「好用」的分界线。

第三类:科学研究、复杂推理、高 stakes 决策。 Terminal-Bench Science 0.1 上,Sol Max 拿到 57.0%($5.47/任务),Astra Max 拿到 68.1%($23.80/任务)。$18.33 的差价换来 11.1 个百分点的绝对提升,对科研场景来说这个置换是划算的——前提是你的研究者时间成本也折算成美元进来算。

场景分层选型决策树

场景分层选型决策树

4.2 性能-成本 Pareto 前沿的移动方向

Pareto 前沿是一个经济学概念,意思是:在所有可行方案里,那些无法在不损害一方性能的前提下降低成本的前沿点。Agent Arena 公布 Sol 的 $0.56 中位任务成本之前,这条前沿基本被 Astra 和 Claude Opus 5 Max 占据。

Sol 的出现把前沿拉出了一个新拐点。具体来说,它比 GPT-6 Sol 便宜 39%、性能还高 1.52 个百分点;比 GPT-6 Astra 便宜 81%、分差缩小到 1.04 个百分点;比 Claude Fable 5 便宜 88%。这意味着什么:在这个价格带,Sol 是唯一的 top-five 选手。

更关键的是,Pareto 前沿的移动方向决定了未来半年行业的竞争格局。OpenAI 把「接近旗舰的性能 + 五分之一的成本」这个点打出来,本质上是在告诉市场:Agent 的门槛已经从「能不能做到」变成了「能不能持续做」。$0.56 的中位任务成本让 Agent 从「专家玩具」变成了「生产工具」。

Anthropic 的 Opus 5.5 在 Terminal-Bench Science 上单任务成本 $23.21,Astra 是 $23.80。Sol 的 $5.47 相当于 Opus 的四分之一不到。这个差距不是调参能追上的,它来自于模型架构本身——循环模型对 CoT 的精确实控,本身就是成本控制的一部分。

4.3 实际部署中的 Ultrafast 版本考量

OpenAI 同时发布了 GPT-6.1 Sol Ultrafast 版本,token 生成速度最高可达前代的八倍。这个版本适合什么样场景,很多人容易误判。

Ultrafast 的本质是减少了推理过程中的思考步数,换的是延迟而非质量。如果你的 Agent 流程里有大量串行调用(比如先分析文档、再提取实体、再写入数据库),每次调用的延迟都会叠加。Ultrafast 在这里的价值是确定性的——延迟降低直接转化为用户体验的提升。

但有一个常见的坑:Ultrafast 的性能下滑不是线性的。有些场景下 Ultrafast 和标准版差距只有 0.5 个百分点,有些场景下可能扩大到 3 个百分点以上。OpenAI 官方建议对「高难度任务」保留标准推理强度,这个建议本身就说明 Ultrafast 不适合全量替换。

实际部署时的取舍建议:先用标准版跑一周的流量,统计各类任务的失败率和用户反馈,再决定哪些环节可以用 Ultrafast 做加速。对于代码生成类任务,Sol 的标准版和 Ultrafast 版在 DeepSWE v1.1 上的差距已经通过缓存机制被压缩——重复请求同一个代码库时,Ultrafast 的优势不如预期那么大。

选 Sol 还是 Astra,不是一个关于性能的单选题,而是一个关于成本结构的工程题。Agent 的规模化落地,最终取决于你能不能把 $0.56 这个数字用在刀刃上,而不是把 $23.80 花在每一次推理上。

Arena 的数据已经给出答案,剩下的只是执行。

五、OpenAI 的战略转向:从军备竞赛到成本效率并重

5.1 发布节奏与「干活特化」定位

GPT-6 Sol 最初发布时,业内反馈并不算好。DeepSWE v1.1 低推理强度下仅 37.2%,远低于预期。OpenAI 没有花很长时间修正——七天后,GPT-6.1 Sol 带着显著提升的性能参数和更低的定价策略出场。

关键转变在于定位。Astra 继续承担旗舰角色,处理最困难的研究任务;Sol 则被明确定义为「干活特化版」,聚焦代码生成、电脑操作、科学推理等 Agent 高频场景。这种分层策略的本质,是把性能竞争转化为场景适配竞争。

程序员系列表情:你从我脸上看到了什么

把模型当工具分类使用,而不是当作通用能力衡量

5.2 当 Sonnet 5.5 走同一条路

Anthropic 的 Claude Sonnet 5.5 同样在 Agent Arena 中展现了类似路径。两个模型都在用更低的价格逼近旗舰性能,竞争焦点从「谁更强」转移到「谁在特定场景下更划算」。

这种趋同说明了一个趋势:当 Agent 场景从实验阶段进入生产部署,成本敏感度会急剧上升。一个任务花费 9.44 美元的模型适合研发验证,不适合规模化上线。开发者需要的是一个能在日常工作中稳定使用、且成本可控的工具,而不是排行榜上的第一个名字。

5.3 开发者该适应的新选择框架

OpenAI 的此次调整,要求开发者在模型选型时建立新的评估维度。

程序员系列表情:其实我觉得吧,压力也没那么大

以前选模型看排名,现在选模型算账

在选择模型时,三个关键问题需要先想清楚:任务类型是什么、单任务成本预算是多少、延迟要求有多高。对于代码生成类任务,GPT-6.1 Sol 在 DeepSWE v1.1 上以约五分之一成本达到 Astra 相当水平,显然是更务实的选择。对于涉及复杂科学推理的任务,Astra 在 Terminal-Bench Science 上仍保持 68.1% 的领先分数,多付出的成本换取的是更可靠的结果。

Ultrafast 版本的加入进一步扩展了选择空间。当 token 生成速度可提升八倍时,原本因延迟顾虑而未采用高推理强度模式的场景,现在也有了可行性。这意味着同一个模型可以在不同配置下覆盖更多任务类型。

这种分层策略对行业的直接影响是明确的:Agent 应用的成本门槛在下降,规模化部署的阻力在减少。对于依赖大量 Agent 调用的产品,每节省一个任务成本,年度预算就能腾出可观空间。OpenAI 把 Agent 从「尝鲜工具」推向「工作工具」,靠的不是单项性能的突破,而是整体性价比的重新定义。

判断是工程师的,嘴可以短一点。GPT-6.1 Sol 出现之前的 Agent 开发,像是在买跑车的配置清单上打勾;之后,更像是给日常工作配工具。前者追求极限参数,后者讲究实用匹配。这个转变本身,比任何基准测试数字都更能说明下一阶段 Agent 竞赛的走向。

参考文献

程序员系列表情:你又在偷偷写bug

点这里一键关注『计算机魔术师』

如果浏览器无法直接唤起微信,可在微信内打开公众号主页:计算机魔术师

下一篇:
Muse Spark跑赢Gemini,但真正的底牌是这种设计

分享到这些地方