ИИтак

← Назад

Модель · Qwen

Qwen3-VL 30B-A3B

Недорогая открытая модель Qwen для картинок, документов, видео и управления интерфейсами, уже устаревшая: её сменили более новые версии

вышла 1 апреля 2025

Характеристики

Вышла
1 апреля 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
131 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 32 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,20 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,80 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
апрель 2025
Идентификатор в API
qwen3-vl-30b-a3b

Что это за модель

Qwen3-VL 30B-A3B — средняя по размеру модель из линейки Qwen3-VL. Эта линейка работает одновременно с текстом и изображениями. Модель построена как смесь экспертов (mixture of experts): всего в ней около 30 млрд параметров, но на каждый токен срабатывает лишь около 3 млрд. Поэтому она отвечает быстрее и обходится дешевле плотной модели того же размера. Qwen выложила её в октябре 2025 года в двух вариантах: Instruct отвечает сразу, Thinking сначала рассуждает.

Линейка Qwen3-VL пришла на смену Qwen2.5-VL. Лаборатория заявляет, что модели стали лучше понимать и писать текст, глубже разбирают изображения, точнее определяют, где находятся предметы и что чем загорожено, и лучше понимают видео. Распознавание текста на картинках теперь поддерживает 32 языка против 19 раньше. В архитектуре появились три новых приёма. Первый по-новому кодирует положение элементов во времени, по ширине и по высоте кадра. Второй, DeepStack, объединяет признаки с нескольких слоёв визуального кодировщика. Третий привязывает текстовые метки времени к кадрам видео. В линейке есть модели от 2B до 235B-A22B, и 30B-A3B стоит в её середине.

Модель берут, чтобы разбирать сканы, документы и диаграммы, отвечать на вопросы по картинкам и видео, писать HTML, CSS, JavaScript и схемы Draw.io по скриншоту или ролику. Qwen отдельно выделяет роль визуального агента: модель распознаёт элементы интерфейса на компьютере или телефоне, понимает, зачем они нужны, вызывает инструменты и доводит задачу до конца.

Веса открыты под лицензией Apache 2.0, так что модель можно запускать на своём оборудовании и использовать в коммерческих проектах. Лаборатория выпускала и версии с квантизацией FP8, то есть с урезанной точностью чисел: такой модели нужно меньше видеопамяти. Сама Qwen с тех пор выпустила много более новых моделей, в том числе Qwen3.5-VL и линейку Qwen3.6. Для новых проектов стоит сравнить эту модель с ними.

Источники: Карточка модели на Hugging Face, Репозиторий Qwen3-VL на GitHub

Другие модели семейства

Новости о модели

  1. 01

    Xiaomi перелила навыки MiMo-V2.6 в Qwen3.5-9B и выложила заготовку для обучения агентов

    MiMo · HF

  2. 02

    Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

    Яндекс

  3. 03

    Qwen выложила подсказчик к Qwen-Image-2.1: из короткой просьбы делает подробный запрос

    Qwen · HF

  4. 04

    Расплывчатую правку — в точный запрос: Qwen выложила модель-подсказчик к Qwen-Image-2.1

    Qwen · HF

  5. 05

    Qwen-Image-2.1 научили раздавать по сети — инструкция есть, кода в vLLM-Omni пока нет

    Qwen · X

  6. 06

    Alibaba открыла Qwen-Image-2.1: рисует с прозрачным фоном и правит обведённое кружком

    Qwen · X

все 30 новостей о Qwen3 →

Данные: models.dev (MIT).