它只做语音前端,复杂推理交给 Astra、Luna、Codex 等后端模型,官方称交互性较上一代提升约 30 个百分点。
语音代理的技术门槛,正在从「能不能做」滑向「每分钟几美分」。GPT‑Live‑1 把这条线画得很直白。
传统语音助手是回合制的——你说完、它再答,中间那点延迟和硬打断,正是它一听就像机器的地方。全双工意味着同时听和说,能像真人一样在你话没说完时接一句、也能被你打断而不乱。OpenAI 称,GPT‑Live‑1 在 Full Duplex Bench 上较上一代 GPT‑Realtime‑2.1 提升约 30 个百分点,交互性一项从 45% 上下抬到了 80% 出头(数字为官方给出)。
它的定位很清楚:GPT‑Live‑1 只当语音前端,真正费脑的活交给后端模型——复杂客户问题给 Astra(GPT‑6),排期、订单更新这类高频事务给 Luna,写代码给 Codex,也支持接第三方模型。它还带了电话语音代理的支持,等于把「接电话的那张嘴」和「背后干活的那颗脑子」拆开计价。
OpenAI 给的客户数据里,语言学习平台 Speak 称模型对学习者思考停顿的误打断减少了近八成,Yelp、Fin 等也在内测。但真正会决定它铺多快的,或许不是这些指标,而是那句「每分钟 0.05 美元」——当语音代理的成本被压到这个量级,很多原本嫌贵的电话客服、预约、外呼场景,会重新算一遍这笔账。