ИИтак

← Назад

Модель · Qwen

Qwen3-ASR Flash

Модель Qwen для перевода речи в текст: расшифровывает записи до 5 минут на 11 языках, справляется с шумом и пением

вышла 8 сентября 2025

Характеристики

Вышла
8 сентября 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
53 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 4,1 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,035 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,035 за миллион токенов
Понимает
аудио
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
апрель 2024
Идентификатор в API
qwen3-asr-flash

Что это за модель

Qwen3-ASR-Flash — модель Qwen для распознавания речи (ASR, automatic speech recognition — автоматическое распознавание речи). Она принимает аудиозапись и возвращает текст. В основе лежит мультимодальная Qwen3-Omni, которую дообучили на десятках миллионов часов данных, в основном записей для распознавания речи. Модель доступна только через API в Alibaba Cloud Model Studio, открытых весов у неё нет.

Модель понимает 11 языков, в том числе русский, английский, китайский, японский, корейский и арабский. Она различает акценты, британский и американский английский, китайские диалекты вроде кантонского и сычуаньского, а язык записи определяет сама. К распознаванию можно добавить текстовый контекст в любом виде: список терминов, имён или прошлую переписку. Так модель точнее пишет названия и специальные слова. По словам лаборатории, она расшифровывает даже песни под фоновую музыку, записи с шумом и речь издалека от микрофона. Кроме того, модель всегда определяет эмоцию говорящего — одну из семи, от нейтральной до гнева и страха.

Её берут, чтобы делать субтитры, расшифровывать звонки, интервью и голосовые сообщения. На замерах лаборатории она ошибается реже, чем Gemini 2.5 Pro, GPT-4o Transcribe и Doubao-ASR, на тестах с китайской и английской речью, акцентами, шумом, смешением языков и песнями.

Главное ограничение — длина: за один запрос модель берёт запись не длиннее 5 минут и не больше 10 МБ. Для многочасовых файлов у Alibaba есть отдельная версия Filetrans, а для живого потока — версия Realtime. Через API, совместимый с OpenAI, модель не отдаёт временные метки слов. Под идентификатором qwen3-asr-flash сейчас работает снимок от сентября 2025 года, а более новый выпущен отдельно как qwen3-asr-flash-2026-02-10.

Источники: Анонс Qwen3-ASR-Flash в блоге Qwen, Документация Alibaba Cloud Model Studio

Другие модели семейства

Новости о модели

  1. 01

    Xiaomi перелила навыки MiMo-V2.6 в Qwen3.5-9B и выложила заготовку для обучения агентов

    MiMo · HF

  2. 02

    Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

    Яндекс

  3. 03

    Qwen выложила подсказчик к Qwen-Image-2.1: из короткой просьбы делает подробный запрос

    Qwen · HF

  4. 04

    Расплывчатую правку — в точный запрос: Qwen выложила модель-подсказчик к Qwen-Image-2.1

    Qwen · HF

  5. 05

    Qwen-Image-2.1 научили раздавать по сети — инструкция есть, кода в vLLM-Omni пока нет

    Qwen · X

  6. 06

    Alibaba открыла Qwen-Image-2.1: рисует с прозрачным фоном и правит обведённое кружком

    Qwen · X

все 30 новостей о Qwen3 →

Данные: models.dev (MIT).