Модель · Qwen
Qwen3-Omni Flash
Устаревшая мультимодальная модель Qwen: понимает текст, картинки, звук и видео и отвечает голосом, доступна только через API
вышла 15 сентября 2025
Характеристики
- Вышла
- 15 сентября 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 65 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 16 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,43 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $1,66 за миллион токенов
- Понимает
- текст, изображения, аудио, видео
- Отвечает
- текст, аудио
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- апрель 2024
- Идентификатор в API
- qwen3-omni-flash
Что это за модель
Qwen3-Omni Flash — закрытая версия линейки Qwen3-Omni, доступная только через API облака Alibaba. Qwen3-Omni задумана как одна модель на все виды данных: она принимает текст, изображения, звук и видео и может отвечать как текстом, так и живой речью. По словам лаборатории, качество на тексте и картинках при этом не падает по сравнению с моделями, которые работают с одним видом данных.
Устройство линейки лаборатория описывает в техническом отчёте. Модель состоит из двух частей: «мыслитель» (Thinker) разбирает входные данные и формирует ответ, а «говорящий» (Talker) превращает его в речь. Обе части построены по схеме смеси экспертов (mixture of experts) — на каждом шаге работает только часть параметров. Открытая сестра этой модели, Qwen3-Omni-30B-A3B, имеет 30 млрд параметров, из которых одновременно задействовано около 3 млрд. По замерам лаборатории, открытая версия показала лучший результат среди открытых моделей на 32 из 36 тестов по звуку и видео. Устройство и размер самой Flash Qwen отдельно не описывает.
Модель берут для голосовых помощников, распознавания и расшифровки речи, разбора видео и аудиозаписей, а также для агентов, которым нужно вызывать инструменты по голосовой команде. Письменный текст она понимает на 119 языках, речь на входе — на 19 языках, а говорить умеет на 10, среди них русский.
Модель уже устарела. После неё Qwen выпустила Qwen3.5-Omni и Qwen3.8-Omni-Flash. Последнюю лаборатория называет своей первой мультимодальной моделью, изначально построенной для работы агентов. Веса самой Flash не публиковались, поэтому запустить её на своём оборудовании нельзя. Для этого есть открытая Qwen3-Omni-30B-A3B под лицензией Apache 2.0, но ей нужно от 79 до 145 ГБ видеопамяти в зависимости от длины видео.
Источники: Репозиторий Qwen3-Omni на GitHub, Технический отчёт Qwen3-Omni, Анонс преемницы Qwen3.8-Omni-Flash
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).