---
title: "Transcribe or translate audio using Whisper Large V3"
method: POST
path: "/model/infer/whisper"
tags: ["Speech to Text"]
---

# Transcribe or translate audio using Whisper Large V3

`POST /model/infer/whisper`

Process audio files for transcription or translation with enhanced language support.
Supports multiple audio formats and provides detailed word-level timestamps and speaker diarization.

## Request body

- WhisperV3Request
  - `audio_data` string, required — TEXT FIELD: This is a string field (not a file upload). Provide the audio as a base64-encoded string. First convert your audio file (.mp3, .wav, .flac) to base64, then paste the resulting string here.
  - `language` string, required — Language code (e.g. 'en' for English)
  - `task` 'transcribe' | 'translate', required — Task type - transcribe in source language or translate to English
  - `initial_prompt` string — Optional starting text prompt for context
  - `beam_size` integer — Number of parallel sequences evaluated
  - `best_of` integer — Number of best sequences considered
  - `word_timestamps` boolean — Include word-level timestamps
  - `diarization` boolean — Enable speaker diarization
  - `vad_filter` boolean — Enable voice activity detection filter
  - `without_timestamps` boolean — Exclude timestamps from output
  - `streaming` boolean — Enable streaming output
  - `min_speakers` integer — Minimum number of speakers to detect (0 for automatic)
  - `max_speakers` integer — Maximum number of speakers to detect (0 for automatic)
  - `batch_size` integer — Number of audio samples processed in one batch
  - `length_penalty` number — Penalty for longer sequences (1.0 means no penalty)
  - `patience` number — Beam search patience factor
  - `min_duration_off` number — Minimum duration of silence for a break (seconds)
  - `min_duration_on` number — Minimum duration for speech detection (seconds)
  - `vad_onset` number — Voice activity detection onset threshold
  - `vad_offset` number — Voice activity detection offset threshold
  - `pad_offset` number — Additional padding at segment end (seconds)
  - `pad_onset` number — Additional padding at segment start (seconds)
  - `max_duration` number — Maximum duration to process (seconds)

## Response `200`

Successful transcription

- WhisperV3Response
  - `transcription` string[], required — Array of transcribed text segments
  - `segments` object[]
    - `start` number, required — Start time of segment (seconds)
    - `end` number, required — End time of segment (seconds)
    - `text` string, required — Transcribed text
    - `words` object[] — Word-level timing information
      - `word` string, required
      - `start` number, required
      - `end` number, required
  - `request_time` number, required — Total processing time in seconds
  - `language` string, required — Detected or specified language

## Other responses

- `400` — Invalid request parameters
- `401` — Unauthorized - Invalid token
- `500` — Internal server error

---

[API](https://skmtc.dev/simplismart/apis/flux-dev-api.md) · [All operations](https://skmtc.dev/simplismart/apis/flux-dev-api/llms.txt) · [OpenAPI document](https://skmtc-service-production.skmtc.workers.dev/v1/apis/simplismart/flux-dev-api/revisions/3c868a866748/schema)
