Модель · Qwen
Qwen3-Omni Flash Realtime
Лёгкая модель Qwen для голосового и видеочата в реальном времени: слышит, видит и отвечает голосом. Её уже сменила линейка Qwen3.5-Omni
вышла 15 сентября 2025
Характеристики
- Вышла
- 15 сентября 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 65 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 16 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,52 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $1,99 за миллион токенов
- Понимает
- текст, изображения, аудио, видео
- Отвечает
- текст, аудио
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- апрель 2024
- Идентификатор в API
- qwen3-omni-flash-realtime
Что это за модель
Qwen3-Omni Flash Realtime — закрытая облачная версия линейки Qwen3-Omni для живого разговора. Её не нужно вызывать отдельным запросом на каждую реплику: приложение держит с ней постоянное соединение и непрерывно передаёт звук с микрофона и кадры с камеры, а модель сразу отвечает текстом и голосом. Сервер сам определяет, когда человек начал и закончил говорить. Можно и отключить это и самому решать, когда отправлять данные модели.
В основе линейки лежит схема «Мыслитель — Говорящий» (Thinker–Talker). Одна часть модели понимает текст, картинки, звук и видео и рассуждает. Вторая превращает ответ в речь, как только он начинает появляться. Обе части построены как смесь экспертов: на каждый шаг включается только часть параметров. По замерам лаборатории, в открытой версии задержка от конца фразы до начала ответа опускается до 234 мс. Qwen заявляет, что на 22 из 36 бенчмарков по звуку и видео Qwen3-Omni показала лучший результат среди всех моделей, открытых и закрытых. По распознаванию речи и голосовому диалогу компания сравнивает её с Gemini 2.5 Pro.
Модель берут для голосовых ассистентов, операторов поддержки, устных переводчиков и приложений, где собеседник показывает что-то в камеру и тут же спрашивает об этом. По сравнению с предшественницей Qwen2.5-Omni линейка понимает больше языков, разбирает длинные записи и умеет рассуждать над звуком и видео.
У модели есть ограничения. Документация Alibaba Cloud предупреждает, что в памяти модели остаются только последние восемь реплик диалога. Весов этой версии нет: работает она только через облако Alibaba Cloud. Открыто под лицензией Apache 2.0 выложена родственная модель Qwen3-Omni-30B-A3B. В 2026 году Qwen выпустила линейку Qwen3.5-Omni. По документации, в её версиях для живого разговора есть поиск в интернете, более сложный вызов инструментов и понимание того, когда собеседник перебивает по делу.
Источники: Технический отчёт Qwen3-Omni, Репозиторий Qwen3-Omni на GitHub, Документация Alibaba Cloud: голосовой и видеочат в реальном времени
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).