← 返回 GPT / Codex IP 检测更多资讯 →

OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 提速最高 14 倍

GPT 资讯 · 2026-08-14 · Net.Coffee

不是新模型,是新的一档服务——同样的 Sol,换一种芯片跑。

一句话:OpenAI 放出 Ultrafast 预览,同一个 GPT-5.6 Sol、智能不缩水,输出速度最高冲到每秒 750 个 token,约为标准档的 14 倍,算力由 Cerebras 承载,目前只开给少数 API 客户。

8 月 13 日,OpenAI 在官网挂出 Ultrafast 的预览说明。要先说清楚的是:这不是一个新模型,而是 OpenAI API 里新增的一档服务层级。跑的还是 GPT-5.6 Sol,权重没换,官方明确写了 Ultrafast 与 Standard 的智能水平相同,变的只有出字速度——最高每秒 750 个输出 token,相当于标准处理档的 14 倍上限。同一天 Cerebras 发新闻稿确认,这一档由它的芯片驱动。

提速 14 倍,靠的不是把模型变小

行业里让模型跑快的常规手段就那么几种:换更小的模型、更激进的量化、砍掉推理时的思考预算。共同点是都要拿质量换,所以「快了多少倍」这种数字平时并不值钱。这次的说法不一样在于,OpenAI 和 Cerebras 双方都强调同一件事——模型本身没动。

变量落在硬件那一侧。Cerebras 长期主打的是晶圆级引擎(Wafer-Scale Engine),把一整片晶圆做成一颗芯片,尽可能把模型权重摊在片上存储里。这个路线针对的正是逐 token 生成的痛点:模型每吐一个 token 都要把权重完整读一遍,GPU 方案在这里受显存带宽掣肘,堆卡能把总吞吐做上去,却很难让单个请求本身变快。Cerebras 一直对外强调「单流速度」而不是总吞吐,就是这个缘故。750 这个数字放在日常体感里是什么概念——常见的大模型 API 单请求输出速度通常在每秒几十个 token 的量级。

把当家模型交给别人的芯片跑

比速度数字更值得留意的是这笔合作本身。OpenAI 的算力盘子一向以英伟达、自研方向和云上部署为主,这次是把旗舰模型的一整档服务放到一家专做推理芯片的公司身上。对 Cerebras 是拿到了最硬的一份背书,对 OpenAI 则等于承认:在「低延迟」这个单一维度上,通用 GPU 不是唯一解。

官方措辞里那句「随算力扩充逐步扩大访问」也透着实情。晶圆级芯片的产能与部署规模跟 GPU 完全不是一个量级,所以能开的名额有限,Cerebras 那边挂出的是登记等候。换句话说,这一档现在更像能力展示,不是可以随手接进生产的容量。

每秒 750 个 token 是给谁准备的

OpenAI 列出的首批场景包括故障与安全响应、金融研究、客服与电商,以及语音和开发者代理。这些放在一起看有个共性:链路的下一环不是人,而是另一段程序或另一次调用。

最后这条也解释了开发者代理为什么会被列进首批场景——Codex 这类命令行代理跑一个长任务时,等待时间从来不只是体感问题,它决定了一天能推进多少轮。速度在这类场景里是可以换算成产出的。

预览阶段还没交代的部分

定价没公布,OpenAI 与 Cerebras 双方的稿子里都没给单价;开放规模只说是「少数客户」;上下文长度、速率限制、会不会下放到 ChatGPT 前端,同样没有说明。结合 OpenAI 这个月在额度与套餐上的一连串调整看,Ultrafast 眼下更像是先把能力和合作关系摆出来占位,商业化细节要等容量跟上再谈。

对普通用户来说,短期内屏幕上不会有任何变化——这是纯 API 侧的事。真打算去排队接入的,与其盯名额,不如先把账号那头理顺:OpenAI 对异常出口环境的判定这两年只紧不松,接入前顺手用 GPT / Codex IP 检测 看一眼自己当前的出口 IP 是什么成色,比事后申诉省事得多。