GPT Image 2
GPT Image 2 是 OpenAI 当前 API 里的旗舰图像生成模型。官方文档称它在快速、高质量的生成与编辑上达到当前最佳,并支持灵活尺寸和高保真图像输入。默认快照是 gpt-image-2-2026-04-21。它接受文本和图像输入,通过 v1/images/generations、v1/images/edits 和 Batch 输出图像。Chat Completions 与 Responses 并不直接托管该模型;Responses 仍可通过图像生成工具代为选择 GPT Image 模型。
核心功能
- 生成与编辑:按提示创建图像,或整图/局部修改已有图像。支持 inpainting。
- 灵活尺寸:常用预设包括 1024x1024、1536x1024、1024x1536、2048x2048、2048x1152、3840x2160、2160x3840,以及
auto。边长须为 16px 的倍数,长短边比不超过 3:1,总像素须在 655,360 到 8,294,400 之间。最长边为 3840px。 - 质量与格式:
low、medium、high或auto。默认输出 PNG;JPEG 和 WebP 支持 0 到 100 的output_compression。在意延迟时 JPEG 更快。 - 高保真编辑:编辑请求始终以高保真处理参考图,可能提高输入 token 成本。
- 审核控制:
moderation可为auto(默认)或low。使用 GPT Image 系列前,组织可能需要完成 API Organization Verification。 - 不支持透明背景:
gpt-image-2不支持background: "transparent"。
适用场景
- 商品与营销静帧:先用
quality: "low"打草稿,再把选定结果渲到medium或high。 - 多轮设计:在 GPT-5.6 及更新模型上用 Responses 的图像生成工具,让同一会话先生成再编辑。
- 版式较重的物料:4K 横竖画幅适合海报和幻灯片,但超过 2560x1440(3,686,400 像素)的输出被标为实验性。
- 批量生产:需要离线放量时可用 Batch 端点。
定价
OpenAI 在 API 定价页 按每 100 万 token 给 GPT Image 2 标价(查阅于 2026-08-17):
| 模态 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
| 图像 | $8.00 | $2.00 | $30.00 |
| 文本 | $5.00 | $1.25 | - |
Batch 价格是标准价的一半。图像生成指南还给出常见尺寸的单张输出示例:1024x1024 在 low / medium / high 大约 $0.006 / $0.053 / $0.211;1024x1536 或 1536x1024 在 low / medium 大约 $0.005 / $0.041。高分辨率和编辑任务仍会叠加输入 token。请用官方计算器,不要把这些示例当成完整价目表。
ChatGPT Images 2.0 是面向消费者的兄弟产品,计费面与 API 里的 gpt-image-2 并不相同。
快速开始
- 若开发者控制台要求,先完成 Organization Verification。
- 用
model: "gpt-image-2"调用images.generate,保存返回的b64_json。 - 先用
quality: "low"和较小尺寸,只在最终成品提高质量。 - 需要会话式编辑时,在 GPT-5.6 或更新模型上使用 Responses 的图像生成工具,必要时用
action强制generate或edit。 - 遇到
image_generation_user_error应改提示词,不要盲目重试。
常见问题
这是换了名字的 DALL-E 3 吗?
不是。GPT Image 是更晚的系列。gpt-image-2 是当前 API 旗舰;gpt-image-1.5、gpt-image-1 和 gpt-image-1-mini 仍以不同价格提供。
能锁定版本吗?
能。需要稳定快照时钉住 gpt-image-2-2026-04-21。
为什么请求那么慢?
复杂提示最多可能要两分钟。官方限制里仍包括文字排版不准、角色一致性,以及精确布局控制。
速率限制是多少?
默认图像限额按用量档位提升:Tier 1 为 5 IPM,Tier 5 为 250 IPM;TPM 从 100,000 到 8,000,000。
替代方案
- OpenAI: dall-e-3:工作流仍钉在 DALL-E 上的旧版静帧模型。
- Flux.1 Pro:想换非 OpenAI 供应商时的 Black Forest Labs 商用静帧模型。
- Nano Banana:已经在 Gemini 体系里工作时的 Google 图像产品。
使用技巧
- 先便宜打样再加钱。官方建议用
low做缩略图和迭代。 - 在意延迟就优先 JPEG,无损成片再留 PNG。
- 大批量前重新核对 token 价格。标准表上图像输出是每 100 万 token $30,编辑还会叠加高保真输入 token。
总结
2026 年做新的静帧生成和编辑,尤其是应用里已经有 GPT-5.6 时,应优先看 GPT Image 2。先从低质量方形草稿开始,再读 模型页 和定价计算器,然后再打开 4K 或高保真编辑。
评论
还没有评论。成为第一个评论的人!
相关工具
OpenAI: dall-e-2
developers.openai.com/api/docs/models
上一代 OpenAI DALL-E 2 快照。复核:活图像路径是 GPT Image 2。DALL-E 3 已从 API 移除。
OpenAI: dall-e-3
developers.openai.com/api/docs/models/dall-e-3
OpenAI 2023 年 11 月的图像模型,现已弃用并从 API 移除。官方要求新项目改用 GPT Image 2。
GPT-5.2
developers.openai.com/api/docs/models/gpt-5.2
OpenAI 上一世代前沿模型:40 万上下文、12.8 万最大输出,每百万 token $1.75/$14。文档现推荐 GPT-5.6 Sol。
相关洞察
锁死 Codex 的不是模型,是选择器
你已经为 OpenCode Go、Grok、Z.ai 付过钱了,但 Codex 的 picker 默认只露出 GPT。社区项目 codex-router 做的不是再教一遍安装步骤,而是把已经买过的模型能力接回选择器:密钥不出本机,原生 GPT 也不动。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。