Модель · Qwen
Qwen-VL Max
Устаревшая модель Qwen для понимания картинок, документов и таблиц, бывший флагман линейки Qwen-VL
вышла 8 апреля 2024
Характеристики
- Вышла
- 8 апреля 2024
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 131 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 8,2 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,80 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $3,20 за миллион токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- апрель 2024
- Идентификатор в API
- qwen-vl-max
Что это за модель
Qwen-VL-Max — закрытая модель Alibaba, которая понимает изображения. Она получает на вход картинку и текст, а отвечает текстом. Команда Qwen представила её вместе с младшей Qwen-VL-Plus как усиленную версию открытой Qwen-VL. В анонсе компания назвала её своей самой способной моделью, работающей и с текстом, и с изображениями. Доступна она только через облако Alibaba, открытых весов у неё нет.
По сравнению с открытой Qwen-VL лаборатория выделяет три улучшения. Модель лучше рассуждает о содержимом картинки. Она точнее находит мелкие детали и распознаёт текст на изображении. Кроме того, она принимает снимки высокого разрешения, больше миллиона пикселей, с любым соотношением сторон. От Qwen-VL-Plus она отличается более сильными рассуждениями и тем, что точнее выполняет инструкции.
Модель берут, чтобы читать документы, таблицы и графики, распознавать текст на снимках, узнавать известных людей и достопримечательности, решать задачи по картинке. По замерам лаборатории, у неё 93,1% в DocVQA (вопросы по документам), 79,8% в ChartQA (графики) и 79,5% в TextVQA (текст на фотографиях). Компания заявляет, что по многим тестам модель держится на уровне GPT-4V и Gemini Ultra. В вопросах на китайском и в понимании китайского текста она, по данным Qwen, обходит обе.
Слабее всего модель в сложных рассуждениях: в тесте MMMU у неё 51,4%, в MathVista — 50%, и тут конкуренты впереди. Сейчас Alibaba относит её к устаревшим моделям линейки Qwen-VL и не советует брать для новых проектов. Вместо неё компания предлагает Qwen3.6 и Qwen3.5: они работают с картинками, а новые модели линейки Qwen3-VL ещё и понимают видео.
Источники: Анонс Qwen-VL-Plus и Qwen-VL-Max, Документация Model Studio о моделях зрения
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Данные: models.dev (MIT).