官方称已修复,但社区从 GPT-5.6 发布当天就在报这件事
Adam Fry 的发帖内容很短:团队发现系统在约 3% 的 Pro 和 Thinking 轮次中被意外切换至 GPT-5.5-mini,该问题现已修复,对受影响的用户致歉。没有说缺陷从什么时候开始、影响了多长时间,也没有提被误切的那些请求怎么处理。
3% 听上去像个可以忽略的尾数。但这个比例的分母是 Pro 和 Thinking——恰恰是用户主动挑贵档、并且愿意为多等几十秒买单的那部分请求。换算成体感就是:每三十来次你专门点"深度思考"的对话里,有一次拿回来的是一个轻量模型的答案,界面上还写着你选的那个型号。它不会报错、不会掉线,只是答得浅一点。这类故障最难被发现,也最容易被当成"今天模型状态不好"。
这不是一条突然冒出来的新闻。OpenAI 开发者社区里有一条标题就叫「5.6 pro 自发布起就被自动降级并路由到 5.5 mini」的帖子,最早的报告出现在 7 月 23 日,也就是 GPT-5.6 发布的当天前后。GitHub 上 Codex 仓库同期也有一条 issue,标题措辞更谨慎:「疑似静默重路由:GPT-5.6 Pro 表现得像 Instant / GPT-5.5 Mini」。
用户拿出的证据比"感觉变笨了"扎实得多:
"model_slug":"gpt-5-6-pro",而 "resolved_model_slug" 写的是 "gpt-5-5-mini"——前端选的和后端实际解析出来的对不上;报告覆盖的是月付 100 美元、200 美元的 Pro 档以及 Medium 档。截至该帖 8 月 6 日的最后一条可见回复,问题在多个账号、多个平台上仍未解决;有用户提到客服反复索要录屏和 HAR 文件,随后就没有下文了。从这个角度看,8 月 26 日这句"已修复致歉"更像是一场持续一个月的拉锯的收尾,而不是一次即时响应。
会出现"选了 A 拿到 B",根子在于现在的对话产品早已不是一个模型一个端点。用户点的档位更像一个意图声明,真正决定用哪个后端的是中间那一层路由:它要看提示长度、要不要调工具、当前算力紧不紧张、这个账号的配额还剩多少,然后挑一个它认为合适的模型去跑。绝大多数时候这层调度是有益的——简单问题不必占用最贵的算力。
但它有两个结构性弱点。一是降级路径通常不报错:切到小模型是一次成功的请求,监控看到的是 200,不是 500,靠错误率报警根本抓不住。二是验证权不在用户手里:界面显示的是你的选择,不是系统的执行结果;要不是有人去翻 HAR 里的 resolved_model_slug,这 3% 可能还要更久才被摁出来。这也解释了为什么最先把问题说清楚的是开发者社区而不是官方仪表盘。
社区里追问最多的一条,Fry 的帖子并没有回答:那 3% 的请求,是否照常扣了 Pro 档的额度?会不会退?这个问题在按量计费的语境下不算矫情——付高价档买的本来就是"每一次都用最强的那个",如果三十次里有一次不是,那这份确定性就打了折扣,而用户事后连自己中没中招都查不了。
眼下能自己做的验证并不复杂:对重要的对话留一手 HAR 或截图,重点看 resolved_model_slug 这个字段和你选的档位对不对得上。命令行侧同理,跑 Codex 的时候留意返回里的模型标识,把这条当例行检查而不是出事后才做的取证。至于另一类"明明没选错却总感觉不对劲"——回答被截断、请求莫名超时、同一账号换个网络就正常——那多半不是路由的锅,而是出口 IP 这一层的问题,可以先用 GPT / Codex IP 检测花一分钟看清自己当前落在哪儿;如果问题集中在命令行工具上,Codex 稳定使用那篇里的排查顺序更对症。
这次事件真正的提醒也许是:当产品把模型选择做成一个下拉框,那个下拉框就成了一份承诺。承诺兑现了 97%,不等于没出问题。