Skip to main content
POST
Audio transcription endpoint

Body

multipart/form-data

Audio transcription request schema for OpenAPI documentation This represents the multipart/form-data fields

file
string
required

Audio file (required) - binary audio data

model
string
required

Model identifier (required) - e.g. "openai/whisper-large-v3"

language
string | null

Language code (optional) - e.g. "en", "es"

response_format
string | null

Response format (optional) - one of: "json", "text", "verbose_json"

timestamp_granularities
string[] | null

Timestamp granularities (optional) - supports "segment" and "word" with verbose_json. Multipart requests may send repeated timestamp_granularities[] fields, repeated timestamp_granularities fields, or comma-separated values.

Response

Successful transcription

Audio transcription response (with OpenAPI schema)

text
string
required

Transcribed text

duration
number<double> | null

Total audio duration in seconds

language
string | null

Detected language code

segments
object[] | null

Transcription segments with timing

words
object[] | null

Word-level timing information