Модель · Qwen
Qwen-Omni Turbo
Устаревшая бюджетная модель Qwen, которая понимает текст, картинки, звук и видео и отвечает текстом или голосом; её сменили Qwen3.5-Omni и Qwen3.8-Omni-Flash
вышла 19 января 2025
Характеристики
- Вышла
- 19 января 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 32 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 2 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,07 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0,27 за миллион токенов
- Понимает
- текст, изображения, аудио, видео
- Отвечает
- текст, аудио
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- апрель 2024
- Идентификатор в API
- qwen-omni-turbo
Что это за модель
Qwen-Omni-Turbo — ранняя «всеядная» (omni) модель Alibaba в облачном сервисе Model Studio. Она принимает запрос текстом, картинкой, записью звука или видео и отвечает текстом или синтезированной речью. Ответ приходит только потоком, то есть по частям по мере генерации: без этого режима модель не работает. Видео она разбирает по кадрам, до 80 кадров из одного файла.
Лаборатория больше не обновляет эту линейку. Для анализа текста документация советует перейти на Qwen3.8-Omni-Flash, а для ответов голосом — на Qwen3.5-Omni. Разница заметная: у новых моделей есть режим рассуждений, они понимают 113 языков вместо двух и слушают записи длиной до часа и больше. Qwen3.8-Omni-Flash к тому же умеет искать в интернете.
Модель стоит заметно дешевле большинства моделей в каталоге. Поэтому её брали для простых мультимодальных задач, то есть задач с разными типами данных: коротко описать картинку или ролик, ответить голосом на короткую голосовую реплику. Сейчас она имеет смысл в основном там, где на ней уже построены процессы.
Ограничений много. Понимает и произносит модель только китайский и английский, голосов на выбор всего четыре. Звуковой файл на входе — не длиннее 40 секунд, видео — только одно в запросе. Рассуждать перед ответом и искать в интернете она не умеет.
Источники: Документация Qwen-Omni в Alibaba Cloud Model Studio
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Новости о модели
- 01
Данные: models.dev (MIT).