作者:互联网 时间: 2026-07-29 08:24:05
过去两年里,真正具备进入专业工作流能力的 AI 图像模型,首个就是 GPT-Image-2(也叫 ChatGPT Images 2.0);OpenAI 于 4 月 21 日发布了它。
第二名比它少了 242 分;它在 LM Arena 文生图榜单取得的成绩是 1512 分。
若用模型代差衡量,这一差距近似 DALL-E 与 Nano Banana Pro 之间的距离。
2026 年 4 月 21 日,OpenAI 发布了新一代原生多模态图像生成模型 GPT-Image-2,其内部代号为“Spud”。
在全面升级 GPT-Image-1.5 的同时,它还成为 DALL-E 3 的继任者。
1.原生 Thinking 模式:规划在生图前,自检在生图后
一张图会依次经过创建 → 打草稿 → 生成初稿 → 搭建场景 → 打磨细节 → 收尾 → 润色 → 微调这套完整的八步流程。原因是 GPT-Image-2 接入了 OpenAI O 系列推理模型,而这正是其架构上最核心的创新。
整个过程还能联网搜索、检查错误并迭代修正。这意味着——当你要求它制作财报信息图时,它会先联网获取最新数据,再进行绘图,完成后还会自行核对数字是否出错。
从架构角度看,这是所有 Diffusion 模型都无法做到的。
2.由世界知识驱动
生成结果之所以符合真实产品的视觉规律,是因为 GPT-Image-2 的训练数据明显倾向于 UI 截图、店面招牌、真实界面布局等真实视觉素材。
3. 分镜中的角色一致性
支持生成一组系列物料,例如同一个 IP 形象在 8 个不同场景中的图片
4.像素级区域编辑
对指定区域进行修改时,其余部分基本不会发生漂移。
光照、透视与阴影的一致性都能完整保持。过去在 PS 里“手动抠图改细节”的操作,如今用一句自然语言即可完成。
| 分辨率 | Medium 质量 | High 质量 |
|---|---|---|
| 1536×1024(1.5K) | $0.04/张 | $0.16/张 |
| 2560×1440(2K) | $0.06/张 | $0.22/张 |
| 3840×2160(4K) | $0.10/张 | $0.40/张 |
从 4 月 21 日开始,所有 ChatGPT 用户都可以使用 GPT-Image-2,免费用户也包括在内;不过免费用户仅可使用 Instant Mode(即时模式),Thinking Mode 则位于付费墙之后。
每 24 小时采用滚动窗口计算额度,数量为 2~3 张;到了高峰期,上限会压至 3 张。
实际操作步骤:
当任务与股价、汇率、新闻热点等实时数据有关时,可以直接要求“先联网查最新数据再画图”。这样会触发图像生成 + web search 的组合链路,这个技巧很少有人提到。
如果不清楚怎样订阅GPT,可以参考我此前发布的文章。