← 返回 GPT / Codex IP 检测更多资讯 →

GPT-6 Astra 三项基准打满,99.9% 那条得打折看

首页AI 资讯OpenAI 资讯 · 2026-09-04 · Net.Coffee

三个满分的含金量并不相同,而最危险的那一项已经被锁进了 Daybreak。

要点:OpenAI 于 9 月 3 日发布 GPT-6 Astra,FrontierMath Tier 4、ARC-AGI-3、ExploitBench 三项成绩接近或达到满分,API 标价每百万输入 token 10 美元、输出 50 美元。三个满分里含金量差别很大,其中最扎眼的那个 99.9% 是在一套昂贵的有状态测试框架下跑出来的。

这条消息在过去两天里其实已经露过两次头:先是安全评估报告里 Astra 跨过网络安全「关键」阈值,接着是 gpt-6-astra 这个模型名出现在 OpenAI API 的路由表里。现在正式发布,把前面两次的伏笔都兑上了——它既是 OpenAI 自称迄今最智能、最对齐的模型,也是第一个因为能力太强而被单独上锁的模型。

三个满分,只有一个是干净的

官方给出的成绩单是 FrontierMath Tier 4 得 98%、ARC-AGI-3 得 99.9%、ExploitBench 得 100%。三个数字并排放在一起很唬人,但它们的测量条件并不对等。

另有两个更贴近日常使用的数字:上下文窗口 105 万 token,OSWorld 2.0 的计算机操作项得 72.6%,每个任务耗时比上一代 GPT-5.6 Sol 少约 47%。后者对做自动化的人来说,比数学榜单实在得多。OpenAI 还称该模型帮助把某类素数间隔的上界推进到 186,这一条目前只有官方口径,没有独立同行验证。

10 美元进、50 美元出,快速模式价格翻倍

API 标准定价为每百万输入 token 10 美元、每百万输出 token 50 美元,缓存读取与写入另行计费。API 里同时提供一个快速模式,吞吐最高可达标准模式的 2.5 倍,代价是单价翻一倍。

把这个价位放到本周的另一条行情旁边看会更有意思:同等能力档位的 token 价格指数刚刚跌到历史新低,中低端模型的推理成本几乎是按月往下掉的。旗舰型号反其道而行、维持高单价,说明 OpenAI 并不打算让 Astra 去接那些拼价格的批量活儿,它想守住的是「别的模型做不了、贵也得用」的那一小块。真正会为 50 美元输出价买单的,是能把一次调用换算成工时节省的企业客户,而不是聊天窗口里的普通提问。

「Critical」是一道闸,不是一句形容词

Astra 是 OpenAI 准备度框架下第一个被判定达到网络安全「关键」级的模型。这个级别的定义是:模型能独立地在防护良好的系统里发现并利用零日漏洞。评估过程中它确实做到了——测试里发现了两个此前未知的零日,并把它们串成了一条完整的利用链,据报道目标是 Google 的 V8 引擎。

OpenAI 的处理办法是把能力和放行拆开:模型本体照常发布,涉及漏洞利用的那部分能力被关进 Daybreak Blue 计划,只对经过审核的一小批测试方开放。同时它把网安类越狱的拒答率从 GPT-5.6 Sol 的 59% 提到了 91.5%。这个提升幅度不小,但反过来读也成立:仍有接近一成的绕过尝试是有效的,而这次绕过成功的收益,比以往任何一代都高。

谁先拿到,什么时候轮到你

放行顺序本身就是一份优先级声明:9 月 3 日当天先开给 Trusted Access Program 里的机构客户,随后几天扩到 ChatGPT Plus、Pro、Business、Enterprise 以及 API 和 AWS,网络安全能力单开一条 Daybreak 通道。个人订阅用户排在机构后面,这已经是近几代模型的常态。

轮到自己那天,能不能第一时间用上,往往不取决于订阅等级,而取决于账号那一刻在 OpenAI 眼里是什么状态——新模型开放的头几天,风控和排队叠在一起,登录环节出问题的概率明显高于平时,这种时候先确认自己的出口 IP 在 OpenAI 侧是否干净,比反复刷新模型选择器管用。

至于「这是不是 AGI」这个被反复追问的问题,眼下有件事比它更早需要答案:当一个模型的成绩单要靠 1.9 万美元的测试框架才能复现、其中一项能力必须锁在门禁后面才敢发布,真正被压到的是评测体系和发布流程本身。