模型素质到位之后,产品瓶颈从「模型听不懂」变成了「人说不清」。
这次更新的重点不在「能画什么」,而在「改一张图有多听话」。官方给出的能力描述集中在编辑侧:只改用户要求改的部分,其余保持不动;在多轮对话里持续遵循编辑指令;更好地保留参考照片里的人物特征;处理透明背景等复杂版式;以及在整组图里稳住同一种视觉风格。
随模型一起上线的四项 ChatGPT 功能,指向的是同一个方向:
这四样都不是模型能力,是交互方式。手绘和圈点批注共同解决的是文本提示词的老毛病:位置、比例、遮挡关系这些空间信息,用中文或英文描述都极其低效,而画一笔只要两秒。当图像模型的基础素质到了某个水平,产品的瓶颈就从「模型听不懂」转向「人说不清」,这次更新处理的是后半句。
「较 2.0 最高降低 50%」是一句需要拆开看的表述——「最高」意味着这是特定条件下的上限,不是每次生成都能拿到的平均值。但即便打个对折,对使用方式的影响也是实打实的:出图从「提交后去干别的事」变成「能坐在那儿等」,这个门槛一过,试错次数会成倍上升。
而试错次数正是图像生成质量的实际决定项。没有人第一次提示词就拿到想要的结果,成品往往是十几次微调堆出来的。把单次等待砍掉一半,等于把同样一段时间里的迭代深度翻倍——这比参数表上任何一项指标都更直接地作用在成品上。
Flare 和 Sunburst 同时上线,是把选择权交给调用方的做法。OpenAI 说这两个模型的训练数据涵盖公开互联网信息、第三方合作获得的数据,以及用户与人工训练者提供或生成的材料。
两个并行型号意味着质量与成本之间有一条明确的档位线,批量出图和精修单图不必再用同一套价格。这个模式在文本模型那边已经跑熟了——大中小型号并存,让调用方自己在预算和效果之间取舍。图像侧现在跟上了同一套逻辑。
模型已经向 ChatGPT、ChatGPT Work 与 Codex 的全平台用户推出。至于它是不是「当前最强」,这类形容词的保质期通常以周计。