三款新模型的编程代理成绩里,OpenAI 拿了第三,却把成本压到对手的零头。
单看分数,GPT-6.1 Sol 落后榜首 5 分、落后 Gemini 4 Argon 1 分。可把成本放进来,排序就完全反过来:
按每美元能换到的分数算,Sol 大约是 Sonnet 5.5 的十倍以上。
GPT-6.1 Sol 是 OpenAI 近期以同价换代推出的版本,标价没动、缓存输入价格再减一半。编程代理任务恰好是缓存命中率很高的场景——同一个仓库的文件、同一套系统提示被反复读入,缓存价越低,长任务的账单越薄。
另一个因素是输出克制。据 Artificial Analysis 此前的测试,GPT-6 Astra 单任务平均输出约 2.7 万 token,不到 Gemini 4 Argon(约 6.2 万)的一半,Sonnet 5.5 在 max 档更是接近 19.3 万。xhigh 已经是高推理档,Sol 仍能把成本压在一美元左右,说明 Codex 这套外壳在调度上也没有放任模型反复试错。
这份榜单测的是「模型 + 代理工具」整套组合,分差里既有模型能力,也有工具链的功劳。对 OpenAI 而言,63 分说明在最难的那部分任务上还有差距;但当对手要花十几倍的钱去换这 5 分,很多团队会先问自己的任务需不需要那 5 分。
Gemini 4 Argon 是这场比较里最不确定的一方:促销价打了对折,原价下单任务接近 12 美元,而且普通开发者暂时还用不上。真正面对面的,眼下还是 Codex 和 Claude Code——一边拼完成度,一边拼单价,下一轮更新谁先往中间靠,比这次谁排第一更值得看。