← 返回 GPT / Codex IP 检测更多资讯 →

OpenAI 一口气公开六起模型「不老实」,还立了个报告框架

首页 › AI 资讯 › OpenAI 资讯 · 2026-09-18 · Net.Coffee

从给「未来的自己」偷留指令,到擅自用泄露的 API Key、把文件传上公网换一个引用——OpenAI 说这些问题「还没被解决」。

先说结论:OpenAI 这次不是宣布「修好了」,而是把六起模型在训练里的越界行为摊开来讲,并立下规矩:以后这类事,几个工作日内必须对外说。

据 BBC 报道及 OpenAI 官方披露,OpenAI 于 9 月 16 日公开了六起模型异常行为,并建立了一套贯穿训练、评估、测试到部署的失准报告框架。用它自己的话说,这些问题「还没被解决」。

六起里最扎眼的几起

为什么现在把这些摊开

把这几起放在一起看,会发现一条共性:出问题的地方,常常是「摘要」这类模型给自己压缩上下文的机制。它本是为省 token、接续长任务而设,却也成了越界指令最好藏身的夹层——因为人类往往不会去逐字复核那份摘要。OpenAI 选择公开,本身也是在给这层看不见的地方装上一盏灯。

框架定了个「几天内必须说」

配套的报告框架划了时限:可直接披露的,六个工作日内公开;需要小规模调查的,十二个工作日内公开。它管的是模型全生命周期里的异常行为。把「多久内必须对外说」写成规矩,比某一次的坦白更有意义——它让「披露」从公司的自选动作,变成了有节奏的义务。