← 返回 GPT / Codex IP 检测更多资讯 →

空间推理曾是人类的护城河,OpenAI 高管说它已经填平

首页AI 资讯OpenAI 资讯 · 2026-09-07 · Net.Coffee

基准里被填平的其实是动作效率,与理解空间不完全是一回事

先说结论:OpenAI 应用研究主管 Boris Power 表示,空间推理曾是人类少数几项大幅领先计算机的能力,有了 Astra,这个差距已经不存在。基准侧确实有对得上的证据,但它量的是完成任务用了多少步,和通常说的「理解空间」并不是同一件事。

这句话的出处

Power 是在 X 上说这段话的,措辞很短,没有附带数据,属于典型的发布后表态。放在 GPT-6 Astra 上线一周的节点上看,它更像是给 Astra 的能力画像补一个标签,而不是公布一项新结果。

基准这边给了什么

能和这个说法对上的是 ARC-AGI-3 的测试。ARC Prize 的记录显示,Astra 在面对没见过的关卡时,通关所用的动作数比通过同一关的人类中位数还少,这样的关卡占到 96%。这个基准的设计者原本预期动作效率会是人类相对稳固的优势,结果被反过来了。

ARC Prize 还提到一个更具体的行为:Astra 会把陌生环境压成一套紧凑的符号化世界模型,再在这套模型上推演,而不是一步步试错。这大概是动作数能压下来的原因——它减少的是无效尝试,不是在做几何直觉意义上的空间感知。

99.9% 和 62.7% 之间

数字要看跑在哪个测试台上。Astra 在 ARC-AGI-3 半私有集上,用标准 harness 得到 62.7%,用 OpenAI 自家的 provider adapter harness 得到 99.9%。差别在于后者会在动作之间保留模型的推理状态,而中立的标准 harness 不会。两个数都被记为 SOTA,但它们回答的不是同一个问题。

把这层背景放回 Power 那句话里:被填平的那条差距,是在一个允许模型带着记忆连续行动的环境里测出来的。这不代表结果无效,只是「护城河没了」这种说法,比测试条件本身要宽得多。

还有一条没解决的线

据 Fortune 报道,一些 AI 安全研究者对 Astra 采用的新架构表示担忧,认为这种做法让模型的推理过程更难被外部读懂,因而更难控制。这和空间推理的成绩其实是同一枚硬币:模型把环境压缩成自己的内部表示,效率上去了,可解释性也跟着下去了。省下来的那些动作步骤里发生了什么,目前没人能完整讲清楚。