ИИтак

← Назад

Модель · Qwen

Qwen3-VL Plus

Устаревшая модель Qwen для понимания картинок, видео и документов и управления интерфейсами; её сменили более новые линейки

вышла 23 сентября 2025

Характеристики

Вышла
23 сентября 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
262 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 32 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,20 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$1,60 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
апрель 2025
Идентификатор в API
qwen3-vl-plus

Что это за модель

Qwen3-VL Plus — модель Alibaba из линейки Qwen3-VL, доступная только через API в облаке компании. Она работает со зрением и языком (vision-language): принимает текст, картинки и видео, а отвечает текстом. Линейку Qwen представила в сентябре 2025 года как самую сильную на тот момент в семействе по работе с изображениями. Флагман открытой части линейки — Qwen3-VL-235B-A22B, построенная как смесь экспертов (mixture of experts): из 235 млрд параметров на каждый токен работают около 22 млрд.

По сравнению с Qwen2.5-VL в линейке переделали обработку изображений и видео. Приём DeepStack объединяет признаки с нескольких слоёв визуального кодировщика, чтобы модель лучше замечала мелкие детали. Новая схема кодирования позиций и привязка текста к меткам времени помогают точнее находить события в длинных видео. Распознавание текста на изображениях расширили с 10 до 32 языков. У Plus два режима: с рассуждениями перед ответом и без них, переключаются они одним параметром в запросе.

Модель берут, когда нужно разбирать скриншоты, сканы, таблицы и длинные видео. Лаборатория делает упор на визуального агента: модель умеет управлять интерфейсами компьютера и телефона по снимкам экрана, и компания заявляет лучшие результаты в бенчмарках вроде OSWorld. Она также пишет код по картинке — например, HTML и CSS по макету страницы или схему для Draw.io, — и определяет, где находятся объекты на изображении, в том числе в трёхмерном пространстве.

Веса Plus закрыты: открытые модели линейки выходят по лицензии Apache 2.0, но эта версия доступна только через облако Alibaba. Знания модели ограничены весной 2025 года. С тех пор Qwen выпустила несколько поколений новее — Qwen3.5 и дальше, где работа с изображениями встроена прямо в основные модели. Для новых проектов разумнее смотреть на них.

Источники: Анонс линейки Qwen3-VL, Репозиторий Qwen3-VL на GitHub, Qwen3-VL-Plus в облаке Qwen

Другие модели семейства

Новости о модели

  1. 01

    Xiaomi перелила навыки MiMo-V2.6 в Qwen3.5-9B и выложила заготовку для обучения агентов

    MiMo · HF

  2. 02

    Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

    Яндекс

  3. 03

    Qwen выложила подсказчик к Qwen-Image-2.1: из короткой просьбы делает подробный запрос

    Qwen · HF

  4. 04

    Расплывчатую правку — в точный запрос: Qwen выложила модель-подсказчик к Qwen-Image-2.1

    Qwen · HF

  5. 05

    Qwen-Image-2.1 научили раздавать по сети — инструкция есть, кода в vLLM-Omni пока нет

    Qwen · X

  6. 06

    Alibaba открыла Qwen-Image-2.1: рисует с прозрачным фоном и правит обведённое кружком

    Qwen · X

все 30 новостей о Qwen3 →

Данные: models.dev (MIT).