Skip to main content
图片分析是“模型看图并回答问题”的能力,适合截图理解、票据识别、图表分析、产品图质检、图片问答等场景。它和 图像生成 不同:本页是理解已有图片,图像生成是创建新图片。

常用接口

多数图片分析模型仍使用文本对话接口:
区别在于 messages.content 不再只是字符串,而是文本和图片组成的数组。

支持的模型来源

curl 调用

图片可通过 HTTPS URLbase64 data URL 传入。本地图片可先转 base64:

Python SDK 调用

OpenAI SDK / LiteLLM 的 base64 使用 data:image/png;base64,{base64} 格式;Claude SDK 使用 source.type: "base64";Gemini SDK 直接传字节。每个示例同时演示本地 base64 和远程 URL 两种传图方式。若特殊格式报错,先用 curl 或 OpenAI SDK 验证模型是否支持视觉能力。

图片输入建议

  • 优先使用可公网访问的 HTTPS 图片 URL。
  • base64 图片会显著增加请求体大小,超大图片容易触发 524 超时
  • 截图、票据、表格类图片要保证文字清晰。
  • 批量分析时控制并发,避免 429 限流

常见问题

相关能力

文本对话

不带图片的普通聊天、总结和问答。

图像生成

根据提示词生成新图片。

多模态理解

图片以外的文档、文件和混合输入。

错误排查

处理模型不支持、限流、超时和鉴权问题。