基准里被填平的其实是动作效率,与理解空间不完全是一回事
Power 是在 X 上说这段话的,措辞很短,没有附带数据,属于典型的发布后表态。放在 GPT-6 Astra 上线一周的节点上看,它更像是给 Astra 的能力画像补一个标签,而不是公布一项新结果。
能和这个说法对上的是 ARC-AGI-3 的测试。ARC Prize 的记录显示,Astra 在面对没见过的关卡时,通关所用的动作数比通过同一关的人类中位数还少,这样的关卡占到 96%。这个基准的设计者原本预期动作效率会是人类相对稳固的优势,结果被反过来了。
ARC Prize 还提到一个更具体的行为:Astra 会把陌生环境压成一套紧凑的符号化世界模型,再在这套模型上推演,而不是一步步试错。这大概是动作数能压下来的原因——它减少的是无效尝试,不是在做几何直觉意义上的空间感知。
数字要看跑在哪个测试台上。Astra 在 ARC-AGI-3 半私有集上,用标准 harness 得到 62.7%,用 OpenAI 自家的 provider adapter harness 得到 99.9%。差别在于后者会在动作之间保留模型的推理状态,而中立的标准 harness 不会。两个数都被记为 SOTA,但它们回答的不是同一个问题。
把这层背景放回 Power 那句话里:被填平的那条差距,是在一个允许模型带着记忆连续行动的环境里测出来的。这不代表结果无效,只是「护城河没了」这种说法,比测试条件本身要宽得多。
据 Fortune 报道,一些 AI 安全研究者对 Astra 采用的新架构表示担忧,认为这种做法让模型的推理过程更难被外部读懂,因而更难控制。这和空间推理的成绩其实是同一枚硬币:模型把环境压缩成自己的内部表示,效率上去了,可解释性也跟着下去了。省下来的那些动作步骤里发生了什么,目前没人能完整讲清楚。