分数差 5 分,钱差十几倍。这份榜单测的是模型加工具的整套组合,读法和普通模型排行不太一样。
14.19 除以 1.04,大约是 13.6 倍。换句话说,Sonnet 5.5 多拿的这 5 分,是用十几倍的花费换来的。
Sonnet 5.5 的标价并不算高,每百万输入 2 美元、输出 10 美元,和上一代 Sonnet 持平。拉开差距的是 token 消耗:据 Artificial Analysis 此前的测试,max 推理档下 Sonnet 5.5 平均每个任务输出约 19.3 万 token,远高于同级对手;在它的综合智能指数里,单任务成本约 7.6 美元。放到编程代理场景,多轮读文件、跑测试、反复修改,消耗再翻一倍并不意外。
这也解释了为什么同一个模型在不同榜单上性价比观感差别很大:按 token 单价看它便宜,按任务结账它就是三者里最贵的。
编程代理指数的特点是把模型和它所在的代理外壳一起测——Claude Code 的上下文管理、工具调用策略,Codex 的沙箱与执行方式,都会进分数和账单。所以 68 分不能直接读成「Sonnet 5.5 比 GPT-6.1 Sol 聪明 5 分」,更准确的说法是这套工作流在这批任务上完成得更好。
Gemini 4 Argon 的数字则要打个折看:促销价减半,按原价算单任务约 11.7 美元,而且普通开发者现在还用不上。真正可比的其实是另外两家——一个愿意多花钱换最后几分完成度,一个把价格压到一美元出头。哪种更划算取决于任务失败的代价:一次返工如果要人工花半小时收拾,十几美元的差价可能根本不算什么。