Модель · Qwen
Qwen2.5-VL 7B Instruct
Устаревшая открытая модель Qwen среднего размера: читает картинки, документы и видео, отвечает текстом
вышла 1 сентября 2024
Характеристики
- Вышла
- 1 сентября 2024
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 131 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 8,2 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,35 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $1,05 за миллион токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- апрель 2024
- Идентификатор в API
- qwen2-5-vl-7b-instruct
Что это за модель
Qwen2.5-VL 7B Instruct — модель, которая понимает изображения и видео и отвечает на вопросы о них текстом. Это средний вариант линейки Qwen2.5-VL: кроме неё есть версии на 3 и 72 млрд параметров. Картинки разбирает кодировщик изображений на основе архитектуры ViT (Vision Transformer). Он принимает кадры в исходном разрешении, не сжимая их до одного размера. Чтобы на больших изображениях не тратить лишние вычисления, почти все его слои смотрят только на соседние участки картинки («оконное внимание»). Полноценных слоёв, которые охватывают всё изображение, осталось четыре.
От предшественницы Qwen2-VL модель отличается прежде всего работой с видео и координатами. При обучении ей показывали ролики с разной частотой кадров и отметками времени. Поэтому она, по словам лаборатории, понимает видео длиннее часа и может назвать секунду, на которой произошло событие. Положение предметов на картинке она указывает рамками или точками в настоящих пикселях и выдаёт их в формате JSON. Лаборатория заявляет, что даже младшая версия на 3 млрд параметров обгоняет прежнюю 7B, а сама 7B по её замерам сильнее GPT-4o-mini на многих задачах.
Модель берут, чтобы вытаскивать данные из сканов: счетов, анкет, таблиц, графиков. На вход можно подать документ, а на выходе получить готовую структуру. По замерам Qwen, она набирает 95,7% в DocVQA (вопросы по документам), 87,3% в ChartQA (вопросы по графикам) и 68,2% в MathVista (задачи по математике с рисунками). Она распознаёт текст на многих языках, в том числе вертикальный и арабский. Ещё модель может работать визуальным агентом: смотрит на экран компьютера или телефона и выбирает, какое действие сделать дальше.
Веса открыты под лицензией Apache 2.0, поэтому модель можно запускать у себя и использовать в коммерческих проектах. Контекст за пределами базовой длины модель обрабатывает через растяжение с помощью метода YaRN. Лаборатория предупреждает: в этом режиме заметно хуже получается находить события в видео и предметы на картинке. Сейчас это старое поколение. У Qwen вышли десятки более новых моделей, в том числе мультимодальные из линеек Qwen3.
Источники: Анонс Qwen2.5-VL в блоге Qwen, Карточка модели на Hugging Face
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Новости о модели
- 01
- 02
- 03
Данные: models.dev (MIT).