v1

latestOpenAPI 3.1.02026-07-13154170539.0 KB
Voices

Generate speech from text

Generates audio from text using the specified provider and voice.

post/v0/assistant/voice/generate

Request body

textstring required

Text to synthesize.

provider'cartesia' | 'elevenlabs' | 'openai' required

TTS provider.

voice_idstring required

Provider-specific voice ID for the speech.

model_idstring nullable

Provider-specific model ID (e.g., 'sonic-2' for Cartesia, 'eleven_multilingual_v2' for ElevenLabs, 'gpt-4o-mini-tts' for OpenAI).

output_format'mp3' | 'wav' | 'flac' | 'pcm_s16le' | 'pcm_mulaw'

Desired audio output format. This will determine the Content-Type of the response.

cartesia_languagestring nullable

Language code for Cartesia TTS (e.g., 'en'). If None, Cartesia attempts auto-detection.

cartesia_sample_rateinteger nullable

Optional sample rate for Cartesia (e.g., 24000, 44100). Provider defaults used if None.

cartesia_bit_rateinteger nullable

Optional bit rate for Cartesia lossy formats like MP3 (e.g., 128000). Provider defaults used if None. Not for PCM.

elevenlabs_optimize_streaming_latencyinteger nullable

0-4. Optimize for streaming latency for ElevenLabs.

elevenlabs_voice_settings_stabilitynumber nullable

Stability for ElevenLabs voice settings.

elevenlabs_voice_settings_similarity_boostnumber nullable

Similarity boost for ElevenLabs voice settings.

Response

Audio generated successfully. Content-Type will be audio/mpeg, audio/wav, etc.

{"stackTrail":"paths:/v0/assistant/voice/generate:post:responses:200:content:application/json:schema","oasType":"schema","type":"unknown"}