Модель · Qwen
Qwen-VL Plus
Устаревшая модель Qwen для разбора картинок, документов и текста на фото, облегчённая и более дешёвая версия Qwen-VL Max
вышла 25 января 2024
Характеристики
- Вышла
- 25 января 2024
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 131 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 8,2 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,21 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0,63 за миллион токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- апрель 2024
- Идентификатор в API
- qwen-vl-plus
Что это за модель
Qwen-VL Plus — визуально-языковая модель команды Qwen из Alibaba Cloud. Такая модель принимает картинку и текстовый вопрос к ней, а отвечает текстом. Её показали в январе 2024 года вместе со старшей Qwen-VL Max. Обе модели — закрытые улучшенные версии открытой Qwen-VL, которая вышла в сентябре 2023 года. Лаборатория называла Plus улучшенной моделью, а Max — самой способной в линейке.
По сравнению с открытой Qwen-VL новые версии заметно лучше рассуждают о содержимом изображений и точнее находят мелкие детали, в том числе текст на картинке. Они принимают картинки высокого разрешения, больше миллиона пикселей, и с любым соотношением сторон. По замерам лаборатории, Plus набирает 91,4% в DocVQA (вопросы по сканам документов), 78,1% в ChartQA (вопросы по графикам) и 78,9% в TextVQA (текст на фотографиях). В этих тестах компания ставила её рядом с GPT-4V и Gemini Ultra. В MMMU, где нужно решать задачи университетского уровня с картинками, у неё 45,2%, а у Max — 51,4%.
Её берут там, где нужно быстро и недорого разобрать изображение: прочитать документ или скриншот, вытащить данные из графика или таблицы, описать фото, узнать известное место или человека. В документации Alibaba Cloud такие модели предлагают для подписей к картинкам, ответов на вопросы по изображению и поиска объектов на нём. Лаборатория оговаривается, что поиск объектов надёжен для картинок размером от 480×480 до 2560×2560 пикселей, а за этими пределами точность может падать.
Для сложных рассуждений по картинкам лаборатория рекомендовала более сильную Max. Сейчас модель заметно устарела: с тех пор Qwen выпустила Qwen2-VL, Qwen2.5-VL, Qwen3-VL и следующие мультимодальные линейки. Веса Qwen-VL Plus не публиковались, доступ к ней есть только через API Alibaba Cloud.
Источники: Анонс Qwen-VL Plus и Max в блоге Qwen, Документация Alibaba Cloud по моделям зрения
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Данные: models.dev (MIT).