← 返回 GPT / Codex IP 检测更多资讯 →

750 tokens 每秒的 Ultrafast 档要走出邀请名单

首页 › AI 资讯 › OpenAI 资讯 · 2026-09-27 · Net.Coffee

同一个模型换一块芯片,速度开始在 API 价格表上单独标价

要点:OpenAI 正准备在 9 月 29 日 DevDay 前后把 Ultrafast 这档 API 服务放给更多开发者。它让 GPT-5.6 Sol 的输出速度最高到每秒 750 个 token,约为 Standard 档的 14 倍,目前仍只对受邀客户开放,加价多少没有公布。

同一个模型,换了一块芯片

Ultrafast 不是新模型,而是一档「服务等级」。OpenAI 官方博客把它描述为 GPT-5.6 Sol 的加速运行方式,底层换成了 Cerebras 的晶圆级芯片,而不是常规的 GPU 集群。Cerebras 方面给出的数字是最高每秒 750 个输出 token;按外界测得 Standard 档大约每秒 53 个 token 计算,正好对应官方所说的「最高 14 倍」。

这意味着模型能力本身没有变化:同样的权重、同样的上下文规则,区别只在出字有多快。据 TestingCatalog 报道,开发者之后可能在 Playground 里直接看到 Standard、Fast、Ultrafast 三个选项,像选套餐一样选速度。

为什么先给运维和金融

OpenAI 在预览时点名的试用场景很具体:故障响应与可靠性工具、金融研究、安全工作流。这几类工作有个共同点——从「发现异常」到「拿到分析」之间多等几秒,代价是真金白银。一次线上事故排查如果要让模型连续读几十段日志再给结论,53 token/秒和 750 token/秒的差距,就是一两分钟和十来秒的差距。

反过来说,普通聊天场景对这个速度未必敏感,人读字的速度本来就追不上 53 token/秒。Ultrafast 真正的受益者是「模型输出给另一个程序读」的链路:多步智能体、代码生成后立刻跑测试、批量改写文档,环节越多,每一步省下的时间叠加得越明显。

价格表上空着的那一格

目前能核实的只有 Standard 档价格:GPT-5.6 Sol 输入每百万 token 5 美元、输出每百万 token 30 美元。Ultrafast 要在此基础上加多少,OpenAI 没有公布,受邀客户的实际计费方式外界也看不到。

专用芯片的产能不像 GPU 那样好扩,这可能正是它迟迟停留在邀请制的原因之一。开放范围扩大之后,价格和配额大概率会一起亮出来,而且很可能是分层的:速度越快,每 token 越贵,额度越紧。

速度开始单独标价

过去几年大模型 API 的价格表只有一个维度:模型越强越贵。Ultrafast 把「快」拆出来单卖,等于承认同一份智能在不同时效下值不同的钱。这并不新鲜——云计算早就有按性能分档的实例,CDN 也按带宽和节点分级——只是现在轮到了推理。

值得观察的是 Fast 这一档。如果三档都真的上线,中间那档的定价会决定大多数开发者怎么选:Ultrafast 注定是少数场景的奢侈品,而 Fast 若加价不多,很可能悄悄成为新的默认值,Standard 反倒变成「便宜但慢」的那一档。DevDay 当天的价格页,会比发布会上的任何演示都更说明问题。