Skip to main content
语音能力主要分为两类:语音转文字(STT)文字转语音(TTS)。常见模型可以使用 OpenAI Audio 兼容路径,也可能有厂商原生参数。

语音转文字

适合会议转写、字幕、客服录音分析、语音输入。 常见路径:

文字转语音

适合配音、有声内容、语音播报。 常见路径:

常见参数

文件与超时

  • 大文件更容易触发 524 超时,建议切分后上传。
  • 音频格式、大小限制和时长限制以模型广场说明为准。
  • 批量转写建议控制并发,避免 429 限流

计费

语音模型可能按次数、字符数、音频时长或模型倍率计费。具体以控制台日志和 计费与用量 为准。