跳到主要内容

gpt-image-2 图片上传限制整理

整理 gpt-image-2 图片编辑 API 的上传数量、大小、格式、mask 和压缩建议。

  • LoopRouter
  • 2 分钟阅读
gpt-image-2 图片上传限制整理

本页是基于外部帮助文章的整理笔记,不是原文全文转载。
抓取整理时间:2026-06-22。

结论先行:gpt-image-2 单次最多上传 16 张输入图片、单张需小于 50MB(支持 PNG/WebP/JPG),单次最多输出 n=10 张图,mask 需与原图同尺寸并带 alpha 通道。

核心限制

原文整理了 gpt-image-2 图片编辑接口里最容易混淆的几个限制:

项目整理结论
单次输入图片数最多 16 张
单张图片大小小于 50MB
支持格式PNG、WebP、JPG
传图方式image_urlfile_id
mask 要求与原图同尺寸,带 alpha 通道,且大小也需小于 50MB
单次输出数量n 最多 10 张

工程上不要把 50MB 当成推荐值。它只是硬上限,不是稳定性最优点。这些限制只覆盖上传格式与数量,不涉及调用计费,具体计费口径可以对照 AI API 计费方式整理

为什么不建议传接近 50MB 的图

主要原因有三个:

  1. base64 会膨胀体积。data URL 会让图片体积增加约三分之一,JSON 请求体还会继续增加额外开销。
  2. 上传和服务端解码会变慢。大图在网络波动时更容易触发超时或重试。
  3. 超高分辨率的收益有限。模型通常会做内部预处理,过大的输入图不一定带来可感知的编辑质量提升。

更务实的策略是:单图尽量控制在 1.5MB 左右,超过 5MB 就优先压缩;需要复用的大素材改用 file_id

推荐预处理策略

对图片编辑工作流,可以把上传前处理固定成一段通用逻辑:

长边 <= 3840px
JPG 或 WebP
质量约 85
小图直接 data URL
大图预上传后使用 file_id
mask 永远使用带 alpha 的 PNG

这套规则适合电商商品图、风格参考图、批量改图、Logo 保真编辑等场景。它的目标不是把图片压到最小,而是在稳定性、速度和画质之间取一个更可控的平衡。如果还需要在多个视觉模型之间做选型对比,可以参考 Qwen3 8B/27B 模型选型笔记 里的思路。

接入前检查项

  • 请求构造是否真的使用了 image/images 参数要求的对象格式。
  • 多图编辑是否把“输入图片数”和“输出张数 n”混为一谈。
  • data URL 上传时是否提前计算了 base64 后体积。
  • mask 是否为 PNG,是否存在 alpha 通道。
  • 是否在生产环境中对图片尺寸、格式和体积做统一预校验。

如果你需要同时接入 gpt-image-2 和其他文本、视觉模型,通过 LoopRouter 这类统一网关调用,可以把上传限制、重试和多模态路由的适配逻辑收敛到一处,省去为每个模型单独维护一套预处理规则的成本。

常见问题

gpt-image-2 单次最多能上传几张图片?
最多 16 张输入图片,单张需小于 50MB,支持 PNG、WebP、JPG 格式,可用 image_url 或 file_id 传入。
为什么不建议上传接近 50MB 的图片?
base64 会让体积膨胀约三分之一,大图上传和服务端解码更慢、网络波动时更易超时,且超高分辨率对编辑质量收益有限。建议单图控制在 1.5MB 左右,超过 5MB 先压缩。
gpt-image-2 的 mask 有什么要求?
mask 需与原图同尺寸、带 alpha 通道,且大小同样需小于 50MB。
gpt-image-2 单次最多能输出几张图(n)?
结论先行:单次最多输出 n=10 张图。‘输出张数 n’ 和’输入图片数’(最多 16 张)是两个不同的限制,不要混用,请求构造时要分别对照。
gpt-image-2 上传前推荐用什么预处理参数?
结论先行:长边控制在 3840px 以内,格式用 JPG 或 WebP,质量约 85;小图直接用 data URL,大图预上传后用 file_id,mask 统一用带 alpha 通道的 PNG。