Модель · Qwen
Qwen-Omni Turbo Realtime
Устаревшая голосовая модель Qwen для живого разговора голосом и с камерой, понимает только китайский и английский
вышла 8 мая 2025
Характеристики
- Вышла
- 8 мая 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 32 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 2 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,27 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $1,07 за миллион токенов
- Понимает
- текст, изображения, аудио
- Отвечает
- текст, аудио
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- апрель 2024
- Идентификатор в API
- qwen-omni-turbo-realtime
Что это за модель
Qwen-Omni Turbo Realtime — версия мультимодальной модели Qwen-Omni-Turbo для живого разговора. Мультимодальная значит, что она работает сразу с несколькими видами данных. Модель принимает поток звука и картинок, в том числе кадры с камеры, и сразу отвечает текстом и голосом. Ответ не ждёт конца реплики: модель начинает говорить, пока данные ещё идут.
Работают с ней через облачную платформу Alibaba Cloud Model Studio. Соединение держится постоянно, по протоколу WebSocket, и через него идут звук, кадры и ответы. Модель подходит для голосовых помощников, озвученных чат-ботов и приложений, которые должны отвечать на то, что видит камера. Она умеет вызывать внешние инструменты.
У модели заметные ограничения. Понимать речь и говорить она может только на китайском и английском, голосов на выбор четыре. Искать в интернете и включать режим рассуждений она не умеет. В обычном режиме линейка Qwen-Omni-Turbo принимает в одном запросе один файл, а звук или видео — не длиннее 40 секунд.
Alibaba больше не обновляет линейку Qwen-Omni-Turbo. Для живого голосового общения компания советует переходить на Qwen3.5-Omni. По её словам, новые модели умнее, умеют искать в интернете, лучше вызывают инструменты и лучше слушаются голосовых команд. Для анализа текста без голоса компания предлагает Qwen3.8-Omni-Flash.
Источники: Документация Qwen-Omni в Model Studio, Документация Qwen-Omni-Realtime
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Данные: models.dev (MIT).