数字是 OpenAI 自己报的,对手是上一代的 GB300——看清边界之后,这件事的分量在成本表上。
选这三款模型有个现实考虑:它们都是开放权重,别人也能拿到同样的东西复核。比起只报自家闭源模型的漂亮成绩,这种做法至少给了外部验证一个入口。
数字好看,但边界得说清楚。
其一,对比的是 GB300,没有和刚开始出货的 Vera Rubin 比。拿现役主力做基准是行业常规,可英伟达正在换代,这个"领先"的保质期取决于对方铺货的速度,而不是这批数据本身。
其二,只做推理,不用于训练。专用推理 ASIC 的思路就是砍掉训练所需的那部分灵活性去换能效,在这个赛道上赢通用 GPU 本来就是它该做到的事。这不是通用算力的胜负,两者不在同一张牌桌上。
其三,开发周期的说法眼下并不统一:Tom's Hardware 称这是一颗光罩尺寸的大 ASIC,走的是九个月的极速周期;另有报道称从组队到流片约十六个月。无论按哪个口径,对这种体量的芯片都算快得反常,而快本身也意味着后续量产和良率上还有账要算。
推理成本是 OpenAI 现在最硬的约束。每一次对话、每一个跑在后台的编码任务都在烧推理算力,而这些算力目前几乎全是租来的。自研芯片如果真能把每 token 的电费和折旧压下来,好处的传导顺序大致是:先落到毛利,再落到定价,最后才轮到用户能感觉到的速率限制和响应速度。
OpenAI 说计划年底前在自有算力设施中部署,第二代已在深入开发,第三代在设计中。三代并行推进这件事比单批测试数据更能说明态度——这不是试水,是打算长期把这条线自己攥着。
不过基建换代传导到用户体感要按年算。眼下决定你今天顺不顺的,还是更近的那一层:请求从哪个出口发出去、账号有没有被判成异常。要是最近 ChatGPT 或 Codex 老给你甩风控提示,先看一眼 出口 IP 的检测结果,再对着 Unusual Activity 的判定逻辑 排查,比等新芯片上线现实得多。