同一个模型换一块芯片,速度开始在 API 价格表上单独标价
Ultrafast 不是新模型,而是一档「服务等级」。OpenAI 官方博客把它描述为 GPT-5.6 Sol 的加速运行方式,底层换成了 Cerebras 的晶圆级芯片,而不是常规的 GPU 集群。Cerebras 方面给出的数字是最高每秒 750 个输出 token;按外界测得 Standard 档大约每秒 53 个 token 计算,正好对应官方所说的「最高 14 倍」。
这意味着模型能力本身没有变化:同样的权重、同样的上下文规则,区别只在出字有多快。据 TestingCatalog 报道,开发者之后可能在 Playground 里直接看到 Standard、Fast、Ultrafast 三个选项,像选套餐一样选速度。
OpenAI 在预览时点名的试用场景很具体:故障响应与可靠性工具、金融研究、安全工作流。这几类工作有个共同点——从「发现异常」到「拿到分析」之间多等几秒,代价是真金白银。一次线上事故排查如果要让模型连续读几十段日志再给结论,53 token/秒和 750 token/秒的差距,就是一两分钟和十来秒的差距。
反过来说,普通聊天场景对这个速度未必敏感,人读字的速度本来就追不上 53 token/秒。Ultrafast 真正的受益者是「模型输出给另一个程序读」的链路:多步智能体、代码生成后立刻跑测试、批量改写文档,环节越多,每一步省下的时间叠加得越明显。
目前能核实的只有 Standard 档价格:GPT-5.6 Sol 输入每百万 token 5 美元、输出每百万 token 30 美元。Ultrafast 要在此基础上加多少,OpenAI 没有公布,受邀客户的实际计费方式外界也看不到。
专用芯片的产能不像 GPU 那样好扩,这可能正是它迟迟停留在邀请制的原因之一。开放范围扩大之后,价格和配额大概率会一起亮出来,而且很可能是分层的:速度越快,每 token 越贵,额度越紧。
过去几年大模型 API 的价格表只有一个维度:模型越强越贵。Ultrafast 把「快」拆出来单卖,等于承认同一份智能在不同时效下值不同的钱。这并不新鲜——云计算早就有按性能分档的实例,CDN 也按带宽和节点分级——只是现在轮到了推理。
值得观察的是 Fast 这一档。如果三档都真的上线,中间那档的定价会决定大多数开发者怎么选:Ultrafast 注定是少数场景的奢侈品,而 Fast 若加价不多,很可能悄悄成为新的默认值,Standard 反倒变成「便宜但慢」的那一档。DevDay 当天的价格页,会比发布会上的任何演示都更说明问题。