v1

latestOpenAPI 3.0.1MIT2026-07-26236440.2 KB

Create Speech

Generate audio from text using text-to-speech models

post/audio/speech

Request body

modelstring required

The TTS model to use for speech generation

inputstring

The text to convert to speech (OpenAI models)

voicestring

The voice to use for speech generation (OpenAI, Orpheus, PlayAI, ElevenLabs models)

response_format'mp3' | 'opus' | 'aac' | 'flac' | 'wav' | 'pcm'

The audio format for the generated speech

speednumber

The speed of the generated audio

temperaturenumber

Temperature for randomness in speech generation

top_pnumber

Top-p value for nucleus sampling

instructionsstring

Additional instructions to control voice generation (GPT-4o Mini TTS)

speaker_transcriptstring

Speaker transcript for Dia model

cfg_filter_top_kinteger

CFG filter top k value (Dia model)

cfg_scaleinteger

CFG scale value (Dia model)

speech_rateinteger

Speech rate adjustment for Microsoft TTS (-100 to 100)

pitch_adjustmentinteger

Pitch adjustment for Microsoft TTS (-100 to 100)

emotional_stylestring

Emotional style for Microsoft TTS (e.g., 'cheerful', 'sad', 'angry')

Example request

{
  "model": "tts-1",
  "input": "Hello, world! This is a text-to-speech example.",
  "voice": "alloy"
}

Response

Audio file

All 23 operations