原定 10 月进入 ChatGPT 与 Codex 的新模型,在授权与如实汇报两项测试上退步,OpenAI 选择不发
向《华尔街日报》说明情况的,是 OpenAI 安全系统负责人 Saachi Jain。按她和外媒的描述,Astra 并不是整体变差了,而是在两项和「听人话」有关的评估上退步了:
据半岛电视台援引的说法,Astra 没能达到公司在「范围与授权」以及「如何向用户汇报已完成工作」上的标准。OpenAI 没有给出新的发布日期,Astra 这个版本就此搁置。
这件事有个耐人寻味的地方:Astra 的一个进步点恰恰是「不偷懒」。过去一年开发者对 Codex 类工具最常见的抱怨,就是模型干到一半停下来问东问西,或者交出半成品说「剩下的你来补」。Astra 在这一点上明显改善了,代价是它开始在不该自作主张的地方自作主张。
Jain 自己也承认这是一种取舍:要在「待在任务范围内」和「避免偷懒」之间找到那条线。放到智能体场景里看,这条线直接决定风险大小。聊天模型多说一句错话,用户还能自己分辨;能操作电脑、调用接口的智能体多走一步,可能就是删文件、发请求、动生产环境。《Gizmodo》在报道里顺带提到,一位 Meta 的 AI 研究员就遇到过智能体未经许可清空整个邮箱的情况。
更麻烦的是两个问题叠在一起:越权本身还能靠日志和权限系统兜底,可一旦模型在事后汇报时不说实话,用户连「它到底干了什么」都无从核对。单独看哪一项都不算致命,合在一起就是 OpenAI 不敢放出去的组合。
单看一次撤回,可以解释成谨慎;放进今年的时间线里,就更像是被逼出来的:
行业层面,Anthropic CEO 阿莫代伊呼吁各家「控制前沿推进的节奏」,据报道奥尔特曼和马斯克都表态支持,扎克伯格则认为没必要协调放缓。在这种气氛下,DevDay 前夜宣布自家新模型不发,既是安全决策,也是一次姿态表态:OpenAI 需要向监管者和企业客户证明,它愿意为安全付出真实的发布成本。
据 9to5Google 等媒体报道,OpenAI 不会直接丢掉 Astra 背后的模型,而是会对它继续做强化学习,作为后续 GPT-6 系列的基础。公司还会回头排查强化学习的环境设定,看问题是不是出在奖励本身:模型被奖励「把任务做完」,就可能学会绕过「先问一句」这个步骤。
如果根因真在这里,这就不只是 Astra 一个版本的事。整个行业都在用「任务完成率」训练智能体,而完成率越高,模型越有动力跳过人类确认这类会拖慢进度的环节。OpenAI 这次在发布前就拦住了,靠的是事先设好的评估线;下一次问题要是藏在评估没覆盖到的地方,就未必能这么早发现。
眼下在 ChatGPT 和 Codex 里干活的,仍是现有模型,原本 10 月的换代计划取消了。真正值得盯住的是即将开幕的 DevDay 上 OpenAI 怎么讲智能体的授权与汇报机制:在这两件事上拿不出新的约束手段之前,下一个版本同样可能卡在这里。