ИИтак

← Назад

Модель · Qwen

Qwen3-VL 235B-A22B

Устаревшая открытая модель Qwen для картинок, документов, видео и управления интерфейсами, в 2025 году была флагманом линейки Qwen3-VL

вышла 1 апреля 2025

Характеристики

Вышла
1 апреля 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
131 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 32 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,70 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$2,80 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
апрель 2025
Идентификатор в API
qwen3-vl-235b-a22b

Что это за модель

Qwen3-VL 235B-A22B — старшая модель линейки Qwen3-VL. Это линейка моделей Alibaba, которые понимают и текст, и изображения. Её веса открыли в сентябре 2025 года в двух вариантах: Instruct отвечает сразу, Thinking сначала рассуждает. Модель устроена как смесь экспертов (mixture of experts): всего в ней 235 млрд параметров, но на каждый токен работают только около 22 млрд. Поэтому она отвечает быстрее, чем плотная модель того же размера.

По сравнению с прежними визуальными моделями Qwen лаборатория переделала работу с картинками и видео. Новая схема кодирования позиций (Interleaved-MRoPE) учитывает сразу время, высоту и ширину кадра. Приём DeepStack объединяет признаки с разных слоёв визуального кодировщика. Ещё модель привязывает текст к меткам времени, так что может указать, в какой момент видео что-то произошло. По замерам лаборатории, вариант Instruct на основных визуальных бенчмарках не уступает Gemini 2.5 Pro, а вариант Thinking обходит её в задачах по математике с картинками, например в MathVision.

Модель берут, чтобы разбирать сканы и документы: распознавание текста работает на 32 языках. Она также понимает длинные видео, отвечает на вопросы о расположении предметов в пространстве и пишет код интерфейса по скриншоту. Ещё она умеет работать визуальным агентом: находит кнопки на экране компьютера или телефона, понимает, что они делают, и доводит задачу до конца. Компания заявляет о лучшем результате среди моделей в бенчмарке OSWorld, где проверяют управление компьютером.

Веса выложены под лицензией Apache 2.0, она разрешает и коммерческое использование. Но модель весит около 470 ГБ, и для запуска нужен сервер с несколькими мощными видеокартами. С тех пор у Qwen вышло много более новых моделей, включая линейки Qwen3.5 и Qwen3.6, которые понимают изображения изначально. Поэтому для новых проектов эту модель стоит сравнить с ними.

Источники: Анонс Qwen3-VL в блоге Qwen, Репозиторий Qwen3-VL на GitHub, Карточка модели на Hugging Face

Другие модели семейства

Новости о модели

  1. 01

    Xiaomi перелила навыки MiMo-V2.6 в Qwen3.5-9B и выложила заготовку для обучения агентов

    MiMo · HF

  2. 02

    Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

    Яндекс

  3. 03

    Qwen выложила подсказчик к Qwen-Image-2.1: из короткой просьбы делает подробный запрос

    Qwen · HF

  4. 04

    Расплывчатую правку — в точный запрос: Qwen выложила модель-подсказчик к Qwen-Image-2.1

    Qwen · HF

  5. 05

    Qwen-Image-2.1 научили раздавать по сети — инструкция есть, кода в vLLM-Omni пока нет

    Qwen · X

  6. 06

    Alibaba открыла Qwen-Image-2.1: рисует с прозрачным фоном и правит обведённое кружком

    Qwen · X

все 30 новостей о Qwen3 →

Данные: models.dev (MIT).