← 返回 Claude AI IP 检测更多资讯 →

OpenAI 连改三处评测数字,Fable 5.1 数学分被调低又调回

首页AI 资讯Claude 资讯 · 2026-09-07 · Net.Coffee

厂商自评表里,对手那一行是约束力最弱的一栏

怎么回事:OpenAI 在 9 月 3 日发布 GPT-6 Astra 的博客上线后,又多轮改动了里面的评测数字。改动既落在自家模型上——Astra 的幻觉率一度从 4.2% 砍到 2%,随后退回;也落在对手身上:Anthropic 的 Fable 5.1 在 FrontierMath Tier 4 上的成绩先是 87.8%,一度被改成 78%,目前显示 83%。而 Astra 自己那一行,从头到尾没动过。

动的是哪几个数

据 Fortune 报道,这篇博客本身的上线就不太顺:原定美东时间下午 2 点发布,实际晚了将近两个小时才被广泛看到。上线之后,页面上的数字还在继续变。外界能对上的改动有三处:

OpenAI 对此的说法是,调整是为了让数字代表对模型性能的最佳估计。

为什么偏偏是对手那一栏

三处改动里,最经不起追问的是第三处。Astra 的 97.6% 全程没动,动的是被拿来对照的那两行,其中一行还不属于 OpenAI 自己。按 87.8% 那一版算,两者相差约 10 个百分点;改成 78% 之后,同一张表上的差距接近 20 个百分点。同一个基准、同一个版本号、同一天之内,对照组的成绩换了两次,读者看到的领先幅度也就跟着换了两次。

厂商自评表有个结构性的松动:自家模型的分数出错,会被用户和竞品盯着复现;对手模型的分数出错,往往只有对手有动力纠正,而对手通常不会为别人家的一张图表专门发声明。这一栏因此是整张表里约束力最弱的地方,也是最容易在事后被悄悄修圆的地方。

复现不是做不到,是没人被要求做

FrontierMath 有明确的题目分层和版本号,写成 Tier 4 v2 就意味着评测条件是可以指定的。一个第三方分数要站得住,需要交代的信息其实不多:跑的是哪一版题目、采样参数、尝试次数、是否允许调用工具、判分口径是什么。这些一旦写清楚,分数就不再依赖发布方的善意,任何人都能复核。

而目前公开的对照表通常只有一个孤零零的百分比。于是从 87.8% 到 78% 再到 83%,外界能确认的只有数值变过,无法判断哪一次是错的、错在哪一环。

这类数字该怎么读

发布日的对照表更接近一份营销材料,它的任务是让新模型在一张图里赢下来。真正能拿去做技术决策的,是第三方独立跑分、能复现的评测脚本,以及在自己那点业务数据上的实测结果。Anthropic 至今没有就这次分数变动公开回应,从它的处境看,回应也没什么收益:分数已经改回去一部分,而看过第一版图表的人,不会再回来看第二版。