v

latestOpenAPI 3.1.0Proprietary2026-08-0892426.6 KB
Speech

Complete the open turn, streaming audio as it is generated

Same request as /v1/converse; the response is a text/event-stream: one meta event, audio chunk events as audio is generated (pcm_b64 = base64 raw 16-bit LE PCM at sample_rate), then exactly one end (reply text, audio_seconds, usage, meta) or error. First audio arrives after one ~80 ms frame instead of after the whole clip; closing the connection aborts generation.

post/v1/converse/stream

Request body

modelstring nullable

Public model id (see GET /v1/models). Omit/null for the default model.

Example request

{
  "model": "kalpa-tts-beta-v0.1"
}

Response

Server-sent event stream: meta, audio chunks, then end or error.