Модель · Qwen
Qwen3-VL Plus
Устаревшая модель Qwen для понимания картинок, видео и документов и управления интерфейсами; её сменили более новые линейки
вышла 23 сентября 2025
Характеристики
- Вышла
- 23 сентября 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 262 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 32 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,20 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $1,60 за миллион токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- апрель 2025
- Идентификатор в API
- qwen3-vl-plus
Что это за модель
Qwen3-VL Plus — модель Alibaba из линейки Qwen3-VL, доступная только через API в облаке компании. Она работает со зрением и языком (vision-language): принимает текст, картинки и видео, а отвечает текстом. Линейку Qwen представила в сентябре 2025 года как самую сильную на тот момент в семействе по работе с изображениями. Флагман открытой части линейки — Qwen3-VL-235B-A22B, построенная как смесь экспертов (mixture of experts): из 235 млрд параметров на каждый токен работают около 22 млрд.
По сравнению с Qwen2.5-VL в линейке переделали обработку изображений и видео. Приём DeepStack объединяет признаки с нескольких слоёв визуального кодировщика, чтобы модель лучше замечала мелкие детали. Новая схема кодирования позиций и привязка текста к меткам времени помогают точнее находить события в длинных видео. Распознавание текста на изображениях расширили с 10 до 32 языков. У Plus два режима: с рассуждениями перед ответом и без них, переключаются они одним параметром в запросе.
Модель берут, когда нужно разбирать скриншоты, сканы, таблицы и длинные видео. Лаборатория делает упор на визуального агента: модель умеет управлять интерфейсами компьютера и телефона по снимкам экрана, и компания заявляет лучшие результаты в бенчмарках вроде OSWorld. Она также пишет код по картинке — например, HTML и CSS по макету страницы или схему для Draw.io, — и определяет, где находятся объекты на изображении, в том числе в трёхмерном пространстве.
Веса Plus закрыты: открытые модели линейки выходят по лицензии Apache 2.0, но эта версия доступна только через облако Alibaba. Знания модели ограничены весной 2025 года. С тех пор Qwen выпустила несколько поколений новее — Qwen3.5 и дальше, где работа с изображениями встроена прямо в основные модели. Для новых проектов разумнее смотреть на них.
Источники: Анонс линейки Qwen3-VL, Репозиторий Qwen3-VL на GitHub, Qwen3-VL-Plus в облаке Qwen
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).