Audio

Generate speech

Text-to-speech served by XTTS, Bark, or Qwen3-TTS depending on the pipeline. Audio requests are sent once; do not rely on Idempotency-Key to deduplicate retries.

post/audio/speech

Request body

modelstring required
inputstring required
voicestring
response_format'mp3' | 'wav' | 'flac' | 'opus' | 'aac' | 'pcm'
speednumber

Example request

{
  "model": "kokoro"
}

Response

Audio bytes

Changes