Skip to main content
Embedding 和 Rerank 常用于知识库、语义搜索、推荐、去重和 RAG。
  • Embedding:把文本转换为向量,用于召回相似内容。
  • Rerank:对候选结果重新排序,提高最终命中质量。

Embedding

常见路径:

Rerank

Rerank 的路径和参数可能因模型来源不同而不同。常见输入包括:
  • query:用户问题
  • documents:候选文本列表
  • model:重排模型 ID
  • top_n:返回前 N 条
如果模型广场标记了 Rerank 能力,请优先查看该模型的参数说明。

选择建议

批量与成本

  • 批量向量化时注意单次输入上限。
  • 文档切分不宜过长,否则召回粒度变粗且成本上升。
  • 大批量任务建议加队列和重试,避免 429 限流
  • 具体扣费看 计费与用量

与文本对话配合

RAG 常见流程:
1

离线向量化

将知识库切块后调用 Embedding,存入向量数据库。
2

在线召回

用户提问后向量化 query,检索相关文档。
3

可选重排

使用 Rerank 对候选文档重新排序。
4

生成答案

将高相关文档放入 文本对话模型 的上下文。