Skip to content

Распознавание речи

POST
/api/asr

Распознать речь из аудио- или видеофайла.

Отправьте WAV, MP3, OGG, OGA, FLAC, AAC, Opus, M4A, WebM, AMR, WMA
либо видео MP4, MOV или MKV. Для видео распознаётся звуковая дорожка.
Запрос блокируется до завершения распознавания и возвращает результат в JSON.

Параметр word_timestamps позволяет получить список слов с временными метками.
diarization=true разделяет до четырёх говорящих и включает таймстемпы
независимо от значения word_timestamps.

Authorizations

HTTPBearer

API-ключ в формате: Bearer sk_live_YOUR_API_KEY

Type
HTTP (bearer)
Example"Bearer sk_live_YOUR_API_KEY"

Parameters

Header Parameters

Idempotency-Key

Необязательный ключ 8–160 printable ASCII символов для безопасного retry.

Request Body

multipart/form-data
object

Аудио- или видеофайл для распознавания звуковой дорожки.

Format"binary"

ASR-модель для распознавания.

Default"GENVOICE_ASR"

Возвращать ли таймстемпы для каждого слова.

Defaultfalse

Разделить до четырёх говорящих. Автоматически включает таймстемпы слов; speaker возвращается внутри каждого слова.

Defaultfalse

Responses

Результат распознавания речи.

application/json
JSON
{
"text": "string",
"duration_seconds": 0,
"words": [
{
"text": "string",
"start": 0,
"end": 0,
"speaker": "string"
}
]
}

Playground

Authorization
Headers
Body

Samples