---
title: "Transcribe or translate audio using Whisper Large V2"
method: POST
path: "/model/v2/infer/whisper"
tags: ["Speech to Text"]
---

# Transcribe or translate audio using Whisper Large V2

`POST /model/v2/infer/whisper`

Process audio files for transcription or translation with advanced options

## Request body

- WhisperV2Request
  - `audio_data` string, required — TEXT FIELD: This is a string field (not a file upload). Provide the audio as a base64-encoded string. First convert your audio file (.mp3, .wav, .flac) to base64, then paste the resulting string here.
  - `language` string, required — Language code (e.g. 'en' for English)
  - `task` 'transcribe' | 'translate', required — Task type - transcribe in source language or translate to English
  - `initial_prompt` string — Optional starting text prompt for context
  - `beam_size` integer — Number of parallel sequences evaluated
  - `best_of` integer — Number of best sequences considered
  - `word_timestamps` 0 | 1 — Include word-level timestamps (0=false, 1=true)
  - `diarization` 0 | 1 — Enable speaker diarization (0=false, 1=true)
  - `vad_filter` 0 | 1 — Enable voice activity detection filter (0=false, 1=true)
  - `without_timestamps` 0 | 1 — Exclude timestamps from output (0=false, 1=true)
  - `streaming` 0 | 1 — Enable streaming output (0=false, 1=true)
  - `min_speakers` number — Minimum number of speakers to detect
  - `max_speakers` number — Maximum number of speakers to detect
  - `batch_size` integer — Number of audio samples processed in one batch
  - `length_penalty` number — Penalty for longer sequences
  - `patience` number — Beam search patience factor
  - `min_duration_off` number — Minimum duration of silence for a break
  - `min_duration_on` number — Minimum duration for speech detection
  - `vad_onset` number — Voice activity detection onset threshold
  - `vad_offset` number — Voice activity detection offset threshold
  - `pad_offset` number — Additional padding at segment end
  - `pad_onset` number — Additional padding at segment start
  - `max_duration` number — Maximum duration to process

## Response `200`

Successful transcription

- WhisperV2Response
  - `transcription` string[] — Array of transcribed text segments
  - `segments` object[]
    - `start` number — Start time of segment
    - `end` number — End time of segment
    - `text` string — Transcribed text
    - `words` object[] — Word-level timing information
      - `word` string
      - `start` number
      - `end` number
  - `request_time` number — Total processing time in seconds
  - `language` string — Detected or specified language

## Other responses

- `400` — Invalid request parameters
- `401` — Unauthorized - Invalid token
- `500` — Internal server error

---

[API](https://skmtc.dev/simplismart/apis/flux-dev-api.md) · [All operations](https://skmtc.dev/simplismart/apis/flux-dev-api/llms.txt) · [OpenAPI document](https://skmtc-service-production.skmtc.workers.dev/v1/apis/simplismart/flux-dev-api/revisions/3c868a866748/schema)
