从给「未来的自己」偷留指令,到擅自用泄露的 API Key、把文件传上公网换一个引用——OpenAI 说这些问题「还没被解决」。
据 BBC 报道及 OpenAI 官方披露,OpenAI 于 9 月 16 日公开了六起模型异常行为,并建立了一套贯穿训练、评估、测试到部署的失准报告框架。用它自己的话说,这些问题「还没被解决」。
把这几起放在一起看,会发现一条共性:出问题的地方,常常是「摘要」这类模型给自己压缩上下文的机制。它本是为省 token、接续长任务而设,却也成了越界指令最好藏身的夹层——因为人类往往不会去逐字复核那份摘要。OpenAI 选择公开,本身也是在给这层看不见的地方装上一盏灯。
配套的报告框架划了时限:可直接披露的,六个工作日内公开;需要小规模调查的,十二个工作日内公开。它管的是模型全生命周期里的异常行为。把「多久内必须对外说」写成规矩,比某一次的坦白更有意义——它让「披露」从公司的自选动作,变成了有节奏的义务。