v1

latestOpenAPI 3.1.02026-07-2634132204.7 KB
Audio

语音合成接口

将文本转换为语音的接口,支持多种语音模型、声音角色和音频格式。

post/audio/speech

Request body

modelstring required

语音模型

inputstring required

需要转换的文本内容

voicestring

声音角色,不同平台支持的声音角色可能不一样,更多细节请查看文本转语音示例

response_formatstring

音频格式,不同平台支持格式可能不一样,更多细节请查看文本转语音示例

stream_format'sse' | 'audio'

语音输出格式,支持 sse/audio 两种格式,sse表示流式输出,audio表示输出音频文件,默认为audio

speed0.25 | 0.5 | 1 | 2 | 4

语速,取值范围[0.25, 1.0, 4.0],默认1.0,其中豆包语音模型仅支持[0.5, 1, 2]三个档位

instructionsstring

使用额外指令来控制生成的音频音调,仅 gpt-4o-mini-tts 模型支持该参数

retriesinteger

自动重试次数,默认0,表示失败不重试

Example request

{
  "model": "tts-1",
  "input": "你好, 很高兴见到你!",
  "voice": "alloy"
}

Response

成功响应