Appearance
Распознавание речи
POST
/api/asr
Распознать речь из аудиофайла.
Отправьте аудиофайл в формате WAV, MP3, OGG, OGA, FLAC, AAC, Opus, M4A, WebM, AMR или WMA.
Запрос блокируется до завершения распознавания и возвращает результат в JSON.
Параметр word_timestamps позволяет получить список слов с временными метками.
diarization=true разделяет до четырёх говорящих и включает таймстемпы
независимо от значения word_timestamps.
Authorizations
HTTPBearer
API-ключ в формате: Bearer sk_live_YOUR_API_KEY
Type
HTTP (bearer)
Example
"Bearer sk_live_YOUR_API_KEY"Parameters
Header Parameters
Idempotency-Key
Необязательный ключ 8–160 printable ASCII символов для безопасного retry.
Request Body
multipart/form-data
file
string
Required
Аудиофайл для распознавания.
Format
"binary"model
const:GENVOICE_ASR
ASR-модель для распознавания.
Default
"GENVOICE_ASR"word_timestamps
boolean
Возвращать ли таймстемпы для каждого слова.
Default
falsediarization
boolean
Разделить до четырёх говорящих. Автоматически включает таймстемпы слов; speaker возвращается внутри каждого слова.
Default
falseResponses
Результат распознавания речи.
application/json
{
"text": "string",
"duration_seconds": 0,
"words": [
{
"text": "string",
"start": 0,
"end": 0,
"speaker": "string"
}
]
}