ИИтак

← Назад

Модель · Qwen

Qwen-VL Max

Устаревшая модель Qwen для понимания картинок, документов и таблиц, бывший флагман линейки Qwen-VL

вышла 8 апреля 2024

Характеристики

Вышла
8 апреля 2024
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
131 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 8,2 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,80 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$3,20 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
апрель 2024
Идентификатор в API
qwen-vl-max

Что это за модель

Qwen-VL-Max — закрытая модель Alibaba, которая понимает изображения. Она получает на вход картинку и текст, а отвечает текстом. Команда Qwen представила её вместе с младшей Qwen-VL-Plus как усиленную версию открытой Qwen-VL. В анонсе компания назвала её своей самой способной моделью, работающей и с текстом, и с изображениями. Доступна она только через облако Alibaba, открытых весов у неё нет.

По сравнению с открытой Qwen-VL лаборатория выделяет три улучшения. Модель лучше рассуждает о содержимом картинки. Она точнее находит мелкие детали и распознаёт текст на изображении. Кроме того, она принимает снимки высокого разрешения, больше миллиона пикселей, с любым соотношением сторон. От Qwen-VL-Plus она отличается более сильными рассуждениями и тем, что точнее выполняет инструкции.

Модель берут, чтобы читать документы, таблицы и графики, распознавать текст на снимках, узнавать известных людей и достопримечательности, решать задачи по картинке. По замерам лаборатории, у неё 93,1% в DocVQA (вопросы по документам), 79,8% в ChartQA (графики) и 79,5% в TextVQA (текст на фотографиях). Компания заявляет, что по многим тестам модель держится на уровне GPT-4V и Gemini Ultra. В вопросах на китайском и в понимании китайского текста она, по данным Qwen, обходит обе.

Слабее всего модель в сложных рассуждениях: в тесте MMMU у неё 51,4%, в MathVista — 50%, и тут конкуренты впереди. Сейчас Alibaba относит её к устаревшим моделям линейки Qwen-VL и не советует брать для новых проектов. Вместо неё компания предлагает Qwen3.6 и Qwen3.5: они работают с картинками, а новые модели линейки Qwen3-VL ещё и понимают видео.

Источники: Анонс Qwen-VL-Plus и Qwen-VL-Max, Документация Model Studio о моделях зрения

Другие модели семейства

Данные: models.dev (MIT).