Qwen: Qwen3 ASR Flash

qwen/qwen3-asr-flash-2026-02-10
Документация

Qwen3-ASR-Flash — это сервис автоматического распознавания речи компании Alibaba, построенный на основе Qwen3-Omni и обученный на десятках миллионов часов мультимодальных речевых данных. Модель поддерживает 11 языков, включая китайский (с кантонским, сычуаньским, миньнаньским и у диалектами), английский, арабский, французский, немецкий, испанский, итальянский, португальский, русский, японский и корейский, с автоматическим определением языка, поэтому для аудио со смешанными языками не требуется ручная настройка. Модель предназначена для сложных акустических условий: она транскрибирует текст песен на фоне музыки, обрабатывает шумные и удалённые записи, отфильтровывает тишину и неречевые звуки, а также принимает произвольный контекстный текст (имена, жаргон, доменную терминологию) для смещения распознавания в сторону конкретной лексики.

Модальности
Аудио
< 0,01 ₽ за секунду
Контекст
0
Добавлена
14 мая 2026 г.

Поставщики, endpoint’ы и маршрутизация

Один поставщик может предлагать несколько endpoint-вариантов: стандартный, flex, priority или региональный. Без дополнительных настроек выбирается самый дешёвый доступный endpoint.

Сначала самый дешёвый доступный endpoint
"provider": { "sort": "price" }

1 поставщика · 1 endpoint-вариантов

Поставщик / endpointДанныеЦенаЗадержкаСкоростьДоступность
AlibabaДешевле
alibaba·Стандарт
< 0,01 ₽за секунду100,00%

Красный и жёлтый щиты отмечают предупреждения о данных. Наведите на значок для подробностей. Условия конкретного endpoint могут отличаться от общей политики провайдера.

Цены

Стоимость показана в рублях по текущему курсу пополнения. Итоговая сумма зависит от фактического usage ответа.

ОперацияСтоимость
Аудио< 0,01 ₽за секунду

Бенчмарки

Результаты стандартизированных оценок. Для индексов, ELO и точности большее значение означает лучший результат.

Для этой версии модели публичных результатов пока нет.

Параметры и модальности

Поддержка параметров синхронизирована с текущей версией модели.

Входные модальности

audio

Выходные модальности

transcription
max_tokenspresence_penaltyresponse_formatseedtemperaturetop_p

Пример запроса

AUDIO_BASE64=$(base64 < audio.wav | tr -d '\n')

curl https://gorouter.ru/api/v1/audio/transcriptions \
  -H "Authorization: Bearer $GOROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{"model":"qwen/qwen3-asr-flash-2026-02-10","input_audio":{"data":"$AUDIO_BASE64","format":"wav"}}"