Модель · Qwen
Qwen3-ASR Flash
Модель Qwen для перевода речи в текст: расшифровывает записи до 5 минут на 11 языках, справляется с шумом и пением
вышла 8 сентября 2025
Характеристики
- Вышла
- 8 сентября 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 53 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 4,1 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,035 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0,035 за миллион токенов
- Понимает
- аудио
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- апрель 2024
- Идентификатор в API
- qwen3-asr-flash
Что это за модель
Qwen3-ASR-Flash — модель Qwen для распознавания речи (ASR, automatic speech recognition — автоматическое распознавание речи). Она принимает аудиозапись и возвращает текст. В основе лежит мультимодальная Qwen3-Omni, которую дообучили на десятках миллионов часов данных, в основном записей для распознавания речи. Модель доступна только через API в Alibaba Cloud Model Studio, открытых весов у неё нет.
Модель понимает 11 языков, в том числе русский, английский, китайский, японский, корейский и арабский. Она различает акценты, британский и американский английский, китайские диалекты вроде кантонского и сычуаньского, а язык записи определяет сама. К распознаванию можно добавить текстовый контекст в любом виде: список терминов, имён или прошлую переписку. Так модель точнее пишет названия и специальные слова. По словам лаборатории, она расшифровывает даже песни под фоновую музыку, записи с шумом и речь издалека от микрофона. Кроме того, модель всегда определяет эмоцию говорящего — одну из семи, от нейтральной до гнева и страха.
Её берут, чтобы делать субтитры, расшифровывать звонки, интервью и голосовые сообщения. На замерах лаборатории она ошибается реже, чем Gemini 2.5 Pro, GPT-4o Transcribe и Doubao-ASR, на тестах с китайской и английской речью, акцентами, шумом, смешением языков и песнями.
Главное ограничение — длина: за один запрос модель берёт запись не длиннее 5 минут и не больше 10 МБ. Для многочасовых файлов у Alibaba есть отдельная версия Filetrans, а для живого потока — версия Realtime. Через API, совместимый с OpenAI, модель не отдаёт временные метки слов. Под идентификатором qwen3-asr-flash сейчас работает снимок от сентября 2025 года, а более новый выпущен отдельно как qwen3-asr-flash-2026-02-10.
Источники: Анонс Qwen3-ASR-Flash в блоге Qwen, Документация Alibaba Cloud Model Studio
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).