一个参数的事,但它接通的是一条被绕了很久的路
功能是从 OpenAI 开发者账号放出的,目前标注为 preview。对做素材的人来说,这一条抵得上不少参数调优——去背这一步过去一直卡在生成流程之外。
调用方式没有新接口,靠现有的图像生成参数组合:
background 设为 transparent;output_format 用 png(默认值)或 webp——jpeg 没有透明通道,设了也没用;output_compression,WebP 才支持压缩参数。这三条里最容易踩的是第二条:格式选错不会明确告诉你"透明失效了",只会安静地给你一张带底色的图。
在此之前,围绕 GPT-Image-2 的透明背景有过一轮相当混乱的传播——不少第三方文档直接写明该模型不支持 background=transparent,请求会返回错误,社区里流传的是各种绕行方案:先生成纯色底再用外部工具抠、上传遮罩走图像编辑接口、或者干脆退回上一代模型。
所以这次开放的实际意义,与其说是"多了个参数",不如说是把一条被绕了很久的路重新接通。素材类需求的流程链条因此短了一环,中间那道去背工序也不再是必须的外部依赖。
官方的建议是:明确要求一个孤立的主体、置于完全透明的背景上,不要有场景、不要纯色底、不要棋盘格、不要多余的阴影。
把"棋盘格"单独列出来是这份建议里最有意思的一条。原因不难推测——网上展示透明 PNG 的图片几乎都带着那个灰白格子,模型在训练里见到的"透明的样子"就长这样,于是它会老老实实把格子画进去。这是典型的表征混淆:模型学到的是透明的视觉符号,而不是 alpha 通道这件事本身。所以提示词里需要反过来把这个符号明确排除掉。
阴影那一条同理。素材图要能落到任意底色上,投影就必须是可控的,而模型默认倾向于给主体加一点接地阴影让画面"好看",那点阴影一旦烘在图里,换底色时就会露馅。
预览状态意味着行为随时可能调整,也意味着失败样本还会有:同样的提示词,可能这次给出干净的 alpha 通道,下次边缘带一圈半透明的杂边。要接进生产流程,值得在拿到结果后加一道自检——检查角落像素是否真的透明、边缘有没有残留底色,不合格就重试或退回原有的去背环节,而不是默认这一步已经稳了。