v1

latestOpenAPI 3.0.12026-07-26101834.1 KB
Speech to Text

Transcribe or translate audio using Whisper Large V3

Process audio files for transcription or translation with enhanced language support. Supports multiple audio formats and provides detailed word-level timestamps and speaker diarization.

post/model/infer/whisper

Request body

audio_datastring required

TEXT FIELD: This is a string field (not a file upload). Provide the audio as a base64-encoded string. First convert your audio file (.mp3, .wav, .flac) to base64, then paste the resulting string here.

languagestring required

Language code (e.g. 'en' for English)

task'transcribe' | 'translate' required

Task type - transcribe in source language or translate to English

initial_promptstring

Optional starting text prompt for context

beam_sizeinteger

Number of parallel sequences evaluated

best_ofinteger

Number of best sequences considered

word_timestampsboolean

Include word-level timestamps

diarizationboolean

Enable speaker diarization

vad_filterboolean

Enable voice activity detection filter

without_timestampsboolean

Exclude timestamps from output

streamingboolean

Enable streaming output

min_speakersinteger

Minimum number of speakers to detect (0 for automatic)

max_speakersinteger

Maximum number of speakers to detect (0 for automatic)

batch_sizeinteger

Number of audio samples processed in one batch

length_penaltynumber

Penalty for longer sequences (1.0 means no penalty)

patiencenumber

Beam search patience factor

min_duration_offnumber

Minimum duration of silence for a break (seconds)

min_duration_onnumber

Minimum duration for speech detection (seconds)

vad_onsetnumber

Voice activity detection onset threshold

vad_offsetnumber

Voice activity detection offset threshold

pad_offsetnumber

Additional padding at segment end (seconds)

pad_onsetnumber

Additional padding at segment start (seconds)

max_durationnumber

Maximum duration to process (seconds)

Example request

{
  "audio_data": "base64_encoded_audio_content",
  "language": "en",
  "task": "transcribe",
  "initial_prompt": "Meeting transcript between John and Sarah:"
}

Response

Successful transcription

transcriptionstring[] required

Array of transcribed text segments

request_timenumber required

Total processing time in seconds

languagestring required

Detected or specified language

Example response

{
  "transcription": [
    "Hello, this is a test.",
    "The audio quality is good."
  ],
  "segments": [
    {
      "end": 2.5,
      "text": "Hello, this is a test.",
      "words": [
        {
          "word": "Hello",
          "end": 0.5
        }
      ]
    }
  ],
  "request_time": 2.5,
  "language": "en"
}