GPT Image 2
GPT Image 2 是 OpenAI 当前 API 里的旗舰图像生成模型。官方文档称它在快速、高质量的生成与编辑上达到当前最佳,并支持灵活尺寸和高保真图像输入。默认快照是 gpt-image-2-2026-04-21。它接受文本和图像输入,通过 v1/images/generations、v1/images/edits 和 Batch 输出图像。Chat Completions 与 Responses 并不直接托管该模型;Responses 仍可通过图像生成工具代为选择 GPT Image 模型。
核心功能
- 生成与编辑:按提示创建图像,或整图/局部修改已有图像。支持 inpainting。
- 灵活尺寸:常用预设包括 1024x1024、1536x1024、1024x1536、2048x2048、2048x1152、3840x2160、2160x3840,以及
auto。边长须为 16px 的倍数,长短边比不超过 3:1,总像素须在 655,360 到 8,294,400 之间。最长边为 3840px。 - 质量与格式:
low、medium、high或auto。默认输出 PNG;JPEG 和 WebP 支持 0 到 100 的output_compression。在意延迟时 JPEG 更快。 - 高保真编辑:编辑请求始终以高保真处理参考图,可能提高输入 token 成本。
- 审核控制:
moderation可为auto(默认)或low。使用 GPT Image 系列前,组织可能需要完成 API Organization Verification。 - 不支持透明背景:
gpt-image-2不支持background: "transparent"。
适用场景
- 商品与营销静帧:先用
quality: "low"打草稿,再把选定结果渲到medium或high。 - 多轮设计:在 GPT-5.6 及更新模型上用 Responses 的图像生成工具,让同一会话先生成再编辑。
- 版式较重的物料:4K 横竖画幅适合海报和幻灯片,但超过 2560x1440(3,686,400 像素)的输出被标为实验性。
- 批量生产:需要离线放量时可用 Batch 端点。
定价
OpenAI 在 API 定价页 按每 100 万 token 给 GPT Image 2 标价(查阅于 2026-08-17):
| 模态 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
| 图像 | $8.00 | $2.00 | $30.00 |
| 文本 | $5.00 | $1.25 | - |
Batch 价格是标准价的一半。图像生成指南还给出常见尺寸的单张输出示例:1024x1024 在 low / medium / high 大约 $0.006 / $0.053 / $0.211;1024x1536 或 1536x1024 在 low / medium 大约 $0.005 / $0.041。高分辨率和编辑任务仍会叠加输入 token。请用官方计算器,不要把这些示例当成完整价目表。
ChatGPT Images 2.0 是面向消费者的兄弟产品,计费面与 API 里的 gpt-image-2 并不相同。
快速开始
- 若开发者控制台要求,先完成 Organization Verification。
- 用
model: "gpt-image-2"调用images.generate,保存返回的b64_json。 - 先用
quality: "low"和较小尺寸,只在最终成品提高质量。 - 需要会话式编辑时,在 GPT-5.6 或更新模型上使用 Responses 的图像生成工具,必要时用
action强制generate或edit。 - 遇到
image_generation_user_error应改提示词,不要盲目重试。
常见问题
这是换了名字的 DALL-E 3 吗?
不是。GPT Image 是更晚的系列。gpt-image-2 是当前 API 旗舰;gpt-image-1.5、gpt-image-1 和 gpt-image-1-mini 仍以不同价格提供。
能锁定版本吗?
能。需要稳定快照时钉住 gpt-image-2-2026-04-21。
为什么请求那么慢?
复杂提示最多可能要两分钟。官方限制里仍包括文字排版不准、角色一致性,以及精确布局控制。
速率限制是多少?
默认图像限额按用量档位提升:Tier 1 为 5 IPM,Tier 5 为 250 IPM;TPM 从 100,000 到 8,000,000。
替代方案
- OpenAI: dall-e-3:工作流仍钉在 DALL-E 上的旧版静帧模型。
- Flux.1 Pro:想换非 OpenAI 供应商时的 Black Forest Labs 商用静帧模型。
- Nano Banana:已经在 Gemini 体系里工作时的 Google 图像产品。
使用技巧
- 先便宜打样再加钱。官方建议用
low做缩略图和迭代。 - 在意延迟就优先 JPEG,无损成片再留 PNG。
- 大批量前重新核对 token 价格。标准表上图像输出是每 100 万 token $30,编辑还会叠加高保真输入 token。
总结
2026 年做新的静帧生成和编辑,尤其是应用里已经有 GPT-5.6 时,应优先看 GPT Image 2。先从低质量方形草稿开始,再读 模型页 和定价计算器,然后再打开 4K 或高保真编辑。
评论
还没有评论。成为第一个评论的人!
相关工具
FLUX 3
bfl.ai/models/flux-3
Black Forest Labs 多模态模型,覆盖视频、音频、即将推出的图像与动作预测,支持最长 20 秒片段、原生音频和先草稿后精渲。
GPT-5.6 Sol
openai.com/index/previewing-gpt-5-6-sol
OpenAI 前沿旗舰:1,050K token 上下文、最高 max 档推理强度与 ultra 子智能体模式,Terminal Bench 2.1 编程刷新 SOTA,定价每 1M token $5/$30。
OpenAI
platform.openai.com
领先的人工智能研究公司,提供前沿的语言模型、图像生成、语音识别和多模态 AI 能力。