Skip to main content
图像编辑是 图片 + 文本指令 → 新图片。它和 图像生成 的区别是:编辑任务必须提供 image 输入,模型需要在原图或参考图基础上修改。 适合场景:
  • 换背景、改颜色、改风格
  • 保留主体,重绘细节
  • 局部修改和蒙版编辑
  • 用参考图生成同风格素材
图像编辑的输入格式、是否支持 mask、可上传图片数量、输出尺寸,都会随模型版本变化。上线前请以控制台 模型广场 为准。

GPT 图像编辑

GPT 图像编辑通常使用 OpenAI Images Edit 兼容方式。请求重点是 imageprompt

GPT 图像编辑参数

Gemini 图片编辑

Gemini 图片编辑通常用 GenAI 多模态内容:contents 里同时传文本指令和图片输入,并要求返回 TEXT + IMAGE
Gemini 编辑与生图一样:优先用 response.parts + part.as_image() 保存(需 pip install pillow)。若网关把图片塞进 part.textdata:image/...;base64,...,需正则提取后解码。不要直接 write(part.inline_data.data) 或先 print(part.text)

Gemini 图片编辑参数

多轮图像编辑

图像编辑天然适合多轮:先做大方向修改,再逐步微调。不同官方 SDK 的多轮方式不同。
OpenAI images.edit 返回 b64_json 字符串,需 base64.b64decode 后保存。Responses 多轮从 image_generation_call.result 取 base64。Gemini 编辑与生图相同,图片可能在 inline_data(用 as_image())或 text 的 data URL 里,不要只依赖 part.inline_data.data

提示词建议

  • 第一轮:“保留人物姿势,把背景换成办公室,整体写实风格。”
  • 第二轮:“保持上一张图的构图,只把衣服改成深蓝色。”
  • 第三轮:“继续保持人物和衣服不变,把光线调成清晨自然光。”

相关能力

图像生成

从文本提示词生成新图片。

图片分析

让模型理解已有图片、截图、票据和图表。