一次发布之后,哪一版数字算数
据 Fortune 报道,博客延迟发布已经不常见,更少见的是发布之后页面仍在变。可以对上的几处改动:
OpenAI 的解释是,调整是为了让数字代表对模型性能的最佳估计。
幻觉率那一处是降了又还回去,看着像一次没校对完就上线的失误。ExploitBench 那一处不一样:它把上一代模型的安全评测成绩上调了一倍多,且保留至今。同一批数据里同时出现「改错了改回来」和「改完就留着」,外界就无从判断这次发布的评测流程到底是哪里没跟上——是数据没定稿,还是口径在发布当天仍在讨论。
问题不在于数字能不能改。评测口径修正很正常,学术论文也会挂勘误。问题在于这篇博客改动时既没有版本号,也没有修订说明,页面永远只展示最新一版。于是唯一能证明改过的东西是第三方存档快照,而这是记者在做的事,不是发布方在做的事。
后果是一份成绩单变得不可引用。任何人写「Astra 幻觉率 2%」都可能是对的,只要他引用的是 9 月 3 日傍晚那一版;写 4.2% 也是对的。同一个来源、同一天,两个互相矛盾的数字都能找到出处。
模型能力的比较最后总会有第三方跑分来兜底,早晚会有确定的答案。但发布过程本身的稳定性没有第三方来测,它只能靠一次次发布积累印象。延迟两小时、改数几轮、不留修订记录,这几件事单看都不大,凑在一次旗舰发布里,就成了另一种可观察的信号。