ИИтак

← Назад

Модель · Qwen

Qwen-VL Plus

Устаревшая модель Qwen для разбора картинок, документов и текста на фото, облегчённая и более дешёвая версия Qwen-VL Max

вышла 25 января 2024

Характеристики

Вышла
25 января 2024
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
131 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 8,2 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,21 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,63 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
апрель 2024
Идентификатор в API
qwen-vl-plus

Что это за модель

Qwen-VL Plus — визуально-языковая модель команды Qwen из Alibaba Cloud. Такая модель принимает картинку и текстовый вопрос к ней, а отвечает текстом. Её показали в январе 2024 года вместе со старшей Qwen-VL Max. Обе модели — закрытые улучшенные версии открытой Qwen-VL, которая вышла в сентябре 2023 года. Лаборатория называла Plus улучшенной моделью, а Max — самой способной в линейке.

По сравнению с открытой Qwen-VL новые версии заметно лучше рассуждают о содержимом изображений и точнее находят мелкие детали, в том числе текст на картинке. Они принимают картинки высокого разрешения, больше миллиона пикселей, и с любым соотношением сторон. По замерам лаборатории, Plus набирает 91,4% в DocVQA (вопросы по сканам документов), 78,1% в ChartQA (вопросы по графикам) и 78,9% в TextVQA (текст на фотографиях). В этих тестах компания ставила её рядом с GPT-4V и Gemini Ultra. В MMMU, где нужно решать задачи университетского уровня с картинками, у неё 45,2%, а у Max — 51,4%.

Её берут там, где нужно быстро и недорого разобрать изображение: прочитать документ или скриншот, вытащить данные из графика или таблицы, описать фото, узнать известное место или человека. В документации Alibaba Cloud такие модели предлагают для подписей к картинкам, ответов на вопросы по изображению и поиска объектов на нём. Лаборатория оговаривается, что поиск объектов надёжен для картинок размером от 480×480 до 2560×2560 пикселей, а за этими пределами точность может падать.

Для сложных рассуждений по картинкам лаборатория рекомендовала более сильную Max. Сейчас модель заметно устарела: с тех пор Qwen выпустила Qwen2-VL, Qwen2.5-VL, Qwen3-VL и следующие мультимодальные линейки. Веса Qwen-VL Plus не публиковались, доступ к ней есть только через API Alibaba Cloud.

Источники: Анонс Qwen-VL Plus и Max в блоге Qwen, Документация Alibaba Cloud по моделям зрения

Другие модели семейства

Данные: models.dev (MIT).