Модель · Qwen
Qwen2.5-Omni 7B
Устаревшая открытая модель Qwen: понимает текст, картинки, звук и видео и отвечает голосом в реальном времени
вышла 1 декабря 2024
Характеристики
- Вышла
- 1 декабря 2024
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 32 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 2 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,10 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0,40 за миллион токенов
- Понимает
- текст, изображения, аудио, видео
- Отвечает
- текст, аудио
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- апрель 2024
- Идентификатор в API
- qwen2-5-omni-7b
Что это за модель
Qwen2.5-Omni 7B — открытая мультимодальная модель команды Qwen из Alibaba на 7 млрд параметров. Она принимает текст, изображения, аудио и видео, а отвечает текстом или живой речью. Устроена по схеме «Мыслитель — Говорящий» (Thinker-Talker). «Мыслитель» — языковая модель со своими кодировщиками для звука и картинок: он разбирает входные данные и пишет текст ответа. «Говорящий» по ходу дела превращает этот ответ в речь, поэтому модель начинает говорить, не дожидаясь конца ответа.
Главное отличие от прежних моделей Qwen — всё собрано в одной модели. Раньше для зрения была Qwen2.5-VL, для звука — Qwen2-Audio. По замерам лаборатории, Omni 7B работает с картинками на уровне Qwen2.5-VL-7B, а со звуком — лучше Qwen2-Audio. Чтобы звук и изображение в видео не расходились, авторы придумали новый способ помечать позицию токенов по времени — TMRoPE. На сводном тесте OmniBench, где нужно сразу понимать звук и изображение, она набрала 56,13%. В нём, по словам лаборатории, модель показала лучший результат среди открытых моделей.
Модель берут для голосовых помощников и видеозвонков с ИИ: она слушает и смотрит одновременно и сразу отвечает голосом. Ещё её используют для распознавания и перевода речи, разбора видео и вопросов по картинкам. Веса открыты под лицензией Apache 2.0, так что модель можно запускать у себя и встраивать в коммерческие продукты.
Ограничения практические. Голосов всего два: женский Chelsie и мужской Ethan. Чтобы модель отвечала голосом, нужен особый системный запрос, который прописан в карточке. Разбор видео требует много видеопамяти: около 31 ГБ на 15 секунд ролика и около 60 ГБ на минуту. Сама лаборатория пишет, что следование голосовым командам и совместное понимание звука и картинки ещё нужно улучшать. Сейчас линейку сменили более новые модели Qwen3.
Источники: Анонс Qwen2.5-Omni в блоге Qwen, Карточка модели на Hugging Face
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Новости о модели
- 01
- 02
- 03
Данные: models.dev (MIT).