v124

OpenAPI 3.1.0MITraw.githubusercontent.com2026-08-01957351.2 MB
TTS

Create speech

Synthesizes audio from the input text. Returns a raw audio bytestream in the requested format (e.g. mp3, pcm, wav).

post/audio/speech

Request body

inputstring required

Text to synthesize

modelstring required

TTS model identifier

response_format'mp3' | 'pcm'

Audio output format

speednumber double

Playback speed multiplier. Only used by models that support it (e.g. OpenAI TTS). Ignored by other providers.

voicestring

Voice identifier (provider-specific).

Example request

{
  "input": "Hello world",
  "model": "mistralai/voxtral-mini-tts-2603",
  "response_format": "pcm",
  "speed": 1,
  "voice": "en_paul_neutral"
}

Response

Audio bytes stream