← 返回 GPT / Codex IP 检测更多资讯 →

博客晚了两小时,Astra 的评测数字之后又改了几轮

首页AI 资讯OpenAI 资讯 · 2026-09-07 · Net.Coffee

一次发布之后,哪一版数字算数

一句话:GPT-6 Astra 的发布博客 9 月 3 日出现罕见延迟,原定美东时间下午 2 点上线,晚了近两小时;上线之后,里面的评测数字又被改了好几轮,改动方向还不一致。

那天下午的时间线

据 Fortune 报道,博客延迟发布已经不常见,更少见的是发布之后页面仍在变。可以对上的几处改动:

OpenAI 的解释是,调整是为了让数字代表对模型性能的最佳估计。

两个方向,两种性质

幻觉率那一处是降了又还回去,看着像一次没校对完就上线的失误。ExploitBench 那一处不一样:它把上一代模型的安全评测成绩上调了一倍多,且保留至今。同一批数据里同时出现「改错了改回来」和「改完就留着」,外界就无从判断这次发布的评测流程到底是哪里没跟上——是数据没定稿,还是口径在发布当天仍在讨论。

没有版本号的成绩单

问题不在于数字能不能改。评测口径修正很正常,学术论文也会挂勘误。问题在于这篇博客改动时既没有版本号,也没有修订说明,页面永远只展示最新一版。于是唯一能证明改过的东西是第三方存档快照,而这是记者在做的事,不是发布方在做的事。

后果是一份成绩单变得不可引用。任何人写「Astra 幻觉率 2%」都可能是对的,只要他引用的是 9 月 3 日傍晚那一版;写 4.2% 也是对的。同一个来源、同一天,两个互相矛盾的数字都能找到出处。

发布这件事也在被评估

模型能力的比较最后总会有第三方跑分来兜底,早晚会有确定的答案。但发布过程本身的稳定性没有第三方来测,它只能靠一次次发布积累印象。延迟两小时、改数几轮、不留修订记录,这几件事单看都不大,凑在一次旗舰发布里,就成了另一种可观察的信号。