适合场景
- 文档摘要和多页材料分析
- 图文混合客服或知识库
- 多文件、多图片和文本混合输入
- 视频帧、PDF 或厂商原生文件输入
调用方式
很多多模态模型仍可通过 文本对话模型 的 Chat Completions 调用,但messages.content 可能需要传数组,包含文本、图片或文件。
示例形态:
Documentation Index
Fetch the complete documentation index at: /llms.txt
Use this file to discover all available pages before exploring further.
FocusAPI 多模态理解接入指南:文档、文件、图文混合输入等能力,说明 GPT、Claude、Gemini 等模型的输入差异和注意事项。
messages.content 可能需要传数组,包含文本、图片或文件。
示例形态:
{
"model": "gpt-4o-mini",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "请描述这张图片" },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.png"
}
}
]
}
]
}
| 来源 | 说明 |
|---|---|
| GPT 多模态 | 通常兼容 OpenAI 风格图文输入 |
| Claude 多模态 | 可能支持 Anthropic Messages 格式,也可通过平台兼容格式调用 |
| Gemini 多模态 | 对图片、视频帧、文件输入支持较强,特殊参数以模型广场为准 |
