← 返回 GPT / Codex IP 检测更多资讯 →

GPT-6.1 Sol 在 Codex 里一题只花 1.04 美元,分数落后 5 分

首页 › AI 资讯 › OpenAI 资讯 · 2026-10-02 · Net.Coffee

三款新模型的编程代理成绩里,OpenAI 拿了第三,却把成本压到对手的零头。

要点:本周 Artificial Analysis 编程代理指数更新,GPT-6.1 Sol(xhigh)在 Codex 中得 63 分,单任务成本 1.04 美元;Gemini 4 Argon 64 分、5.84 美元;Claude Sonnet 5.5 在 Claude Code 中 68 分居首,成本 14.19 美元。

第三名,但便宜一个数量级

单看分数,GPT-6.1 Sol 落后榜首 5 分、落后 Gemini 4 Argon 1 分。可把成本放进来,排序就完全反过来:

按每美元能换到的分数算,Sol 大约是 Sonnet 5.5 的十倍以上。

便宜从哪来

GPT-6.1 Sol 是 OpenAI 近期以同价换代推出的版本,标价没动、缓存输入价格再减一半。编程代理任务恰好是缓存命中率很高的场景——同一个仓库的文件、同一套系统提示被反复读入,缓存价越低,长任务的账单越薄。

另一个因素是输出克制。据 Artificial Analysis 此前的测试,GPT-6 Astra 单任务平均输出约 2.7 万 token,不到 Gemini 4 Argon(约 6.2 万)的一半,Sonnet 5.5 在 max 档更是接近 19.3 万。xhigh 已经是高推理档,Sol 仍能把成本压在一美元左右,说明 Codex 这套外壳在调度上也没有放任模型反复试错。

5 分值多少钱

这份榜单测的是「模型 + 代理工具」整套组合,分差里既有模型能力,也有工具链的功劳。对 OpenAI 而言,63 分说明在最难的那部分任务上还有差距;但当对手要花十几倍的钱去换这 5 分,很多团队会先问自己的任务需不需要那 5 分。

Gemini 4 Argon 是这场比较里最不确定的一方:促销价打了对折,原价下单任务接近 12 美元,而且普通开发者暂时还用不上。真正面对面的,眼下还是 Codex 和 Claude Code——一边拼完成度,一边拼单价,下一轮更新谁先往中间靠,比这次谁排第一更值得看。