ИИтак

← Назад

Модель · Qwen

Qwen3-Omni Flash Realtime

Лёгкая модель Qwen для голосового и видеочата в реальном времени: слышит, видит и отвечает голосом. Её уже сменила линейка Qwen3.5-Omni

вышла 15 сентября 2025

Характеристики

Вышла
15 сентября 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
65 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 16 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,52 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$1,99 за миллион токенов
Понимает
текст, изображения, аудио, видео
Отвечает
текст, аудио
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
апрель 2024
Идентификатор в API
qwen3-omni-flash-realtime

Что это за модель

Qwen3-Omni Flash Realtime — закрытая облачная версия линейки Qwen3-Omni для живого разговора. Её не нужно вызывать отдельным запросом на каждую реплику: приложение держит с ней постоянное соединение и непрерывно передаёт звук с микрофона и кадры с камеры, а модель сразу отвечает текстом и голосом. Сервер сам определяет, когда человек начал и закончил говорить. Можно и отключить это и самому решать, когда отправлять данные модели.

В основе линейки лежит схема «Мыслитель — Говорящий» (Thinker–Talker). Одна часть модели понимает текст, картинки, звук и видео и рассуждает. Вторая превращает ответ в речь, как только он начинает появляться. Обе части построены как смесь экспертов: на каждый шаг включается только часть параметров. По замерам лаборатории, в открытой версии задержка от конца фразы до начала ответа опускается до 234 мс. Qwen заявляет, что на 22 из 36 бенчмарков по звуку и видео Qwen3-Omni показала лучший результат среди всех моделей, открытых и закрытых. По распознаванию речи и голосовому диалогу компания сравнивает её с Gemini 2.5 Pro.

Модель берут для голосовых ассистентов, операторов поддержки, устных переводчиков и приложений, где собеседник показывает что-то в камеру и тут же спрашивает об этом. По сравнению с предшественницей Qwen2.5-Omni линейка понимает больше языков, разбирает длинные записи и умеет рассуждать над звуком и видео.

У модели есть ограничения. Документация Alibaba Cloud предупреждает, что в памяти модели остаются только последние восемь реплик диалога. Весов этой версии нет: работает она только через облако Alibaba Cloud. Открыто под лицензией Apache 2.0 выложена родственная модель Qwen3-Omni-30B-A3B. В 2026 году Qwen выпустила линейку Qwen3.5-Omni. По документации, в её версиях для живого разговора есть поиск в интернете, более сложный вызов инструментов и понимание того, когда собеседник перебивает по делу.

Источники: Технический отчёт Qwen3-Omni, Репозиторий Qwen3-Omni на GitHub, Документация Alibaba Cloud: голосовой и видеочат в реальном времени

Другие модели семейства

Новости о модели

  1. 01

    Xiaomi перелила навыки MiMo-V2.6 в Qwen3.5-9B и выложила заготовку для обучения агентов

    MiMo · HF

  2. 02

    Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

    Яндекс

  3. 03

    Qwen выложила подсказчик к Qwen-Image-2.1: из короткой просьбы делает подробный запрос

    Qwen · HF

  4. 04

    Расплывчатую правку — в точный запрос: Qwen выложила модель-подсказчик к Qwen-Image-2.1

    Qwen · HF

  5. 05

    Qwen-Image-2.1 научили раздавать по сети — инструкция есть, кода в vLLM-Omni пока нет

    Qwen · X

  6. 06

    Alibaba открыла Qwen-Image-2.1: рисует с прозрачным фоном и правит обведённое кружком

    Qwen · X

все 30 новостей о Qwen3 →

Данные: models.dev (MIT).