本页是基于外部帮助文章的整理笔记,不是原文全文转载。
抓取整理时间:2026-06-22。
结论先行:gpt-image-2 单次最多上传 16 张输入图片、单张需小于 50MB(支持 PNG/WebP/JPG),单次最多输出 n=10 张图,mask 需与原图同尺寸并带 alpha 通道。
核心限制
原文整理了 gpt-image-2 图片编辑接口里最容易混淆的几个限制:
| 项目 | 整理结论 |
|---|---|
| 单次输入图片数 | 最多 16 张 |
| 单张图片大小 | 小于 50MB |
| 支持格式 | PNG、WebP、JPG |
| 传图方式 | image_url 或 file_id |
| mask 要求 | 与原图同尺寸,带 alpha 通道,且大小也需小于 50MB |
| 单次输出数量 | n 最多 10 张 |
工程上不要把 50MB 当成推荐值。它只是硬上限,不是稳定性最优点。这些限制只覆盖上传格式与数量,不涉及调用计费,具体计费口径可以对照 AI API 计费方式整理。
为什么不建议传接近 50MB 的图
主要原因有三个:
- base64 会膨胀体积。data URL 会让图片体积增加约三分之一,JSON 请求体还会继续增加额外开销。
- 上传和服务端解码会变慢。大图在网络波动时更容易触发超时或重试。
- 超高分辨率的收益有限。模型通常会做内部预处理,过大的输入图不一定带来可感知的编辑质量提升。
更务实的策略是:单图尽量控制在 1.5MB 左右,超过 5MB 就优先压缩;需要复用的大素材改用 file_id。
推荐预处理策略
对图片编辑工作流,可以把上传前处理固定成一段通用逻辑:
长边 <= 3840px
JPG 或 WebP
质量约 85
小图直接 data URL
大图预上传后使用 file_id
mask 永远使用带 alpha 的 PNG
这套规则适合电商商品图、风格参考图、批量改图、Logo 保真编辑等场景。它的目标不是把图片压到最小,而是在稳定性、速度和画质之间取一个更可控的平衡。如果还需要在多个视觉模型之间做选型对比,可以参考 Qwen3 8B/27B 模型选型笔记 里的思路。
接入前检查项
- 请求构造是否真的使用了
image/images参数要求的对象格式。 - 多图编辑是否把“输入图片数”和“输出张数
n”混为一谈。 - data URL 上传时是否提前计算了 base64 后体积。
- mask 是否为 PNG,是否存在 alpha 通道。
- 是否在生产环境中对图片尺寸、格式和体积做统一预校验。
如果你需要同时接入 gpt-image-2 和其他文本、视觉模型,通过 LoopRouter 这类统一网关调用,可以把上传限制、重试和多模态路由的适配逻辑收敛到一处,省去为每个模型单独维护一套预处理规则的成本。
常见问题
gpt-image-2 单次最多能上传几张图片?
最多 16 张输入图片,单张需小于 50MB,支持 PNG、WebP、JPG 格式,可用 image_url 或 file_id 传入。
为什么不建议上传接近 50MB 的图片?
base64 会让体积膨胀约三分之一,大图上传和服务端解码更慢、网络波动时更易超时,且超高分辨率对编辑质量收益有限。建议单图控制在 1.5MB 左右,超过 5MB 先压缩。
gpt-image-2 的 mask 有什么要求?
mask 需与原图同尺寸、带 alpha 通道,且大小同样需小于 50MB。
gpt-image-2 单次最多能输出几张图(n)?
结论先行:单次最多输出 n=10 张图。‘输出张数 n’ 和’输入图片数’(最多 16 张)是两个不同的限制,不要混用,请求构造时要分别对照。
gpt-image-2 上传前推荐用什么预处理参数?
结论先行:长边控制在 3840px 以内,格式用 JPG 或 WebP,质量约 85;小图直接用 data URL,大图预上传后用 file_id,mask 统一用带 alpha 通道的 PNG。
