五比一的输入输出价差,会把成本压力整个推到推理长度这一侧。
除标准档外,公开的档位信息还包括:
输出价是输入价的五倍,这个比例决定了哪类应用会疼。检索问答、文档分类、长文摘要这类「读得多、写得少」的活,账单主要落在便宜的一侧;而推理链条长、要一边思考一边吐字的 agent 类任务,成本几乎全压在贵的那一侧——同一个任务,模型多想两百个 token,花的钱等于多读一千个。
缓存那一档的折扣幅度同样值得算。命中缓存的输入是标准输入的十分之一,写入则是 1.25 倍。这条规则奖励的是稳定、可复用的前缀:长系统提示、固定的工具定义、反复出现的文档上下文,都应该尽量放在提示的前部并保持字节级不变。反过来,在提示开头塞时间戳或随机 ID 这种常见写法,会让整段缓存作废,代价从 1 美元跳回 10 美元。
272K 那道坎则是一个隐形悬崖:它不是超出部分加价,而是整个请求换档计费。一次多塞进去几千 token,可能让这次调用的输入单价直接翻倍。对于按对话历史不断追加上下文的服务来说,这个边界值得写进代码里硬拦一道。
2.5 倍于上一代、且与对手旗舰同价——这不是抢市场的打法。定在这个位置,意味着 OpenAI 认为 Astra 的能力足以支撑同档价格,把选择权交回给买方:贵不贵,取决于它能不能一次把活干对。
对开发者的现实建议反而很老派:先用批处理跑离线任务、把稳定前缀做进缓存、给长上下文设硬上限,再决定要不要为 Fast 模式付双倍。账单的形状,通常由这几个工程决定,而不是由价目表决定。