Модель · Qwen
Qwen3-VL 30B-A3B
Недорогая открытая модель Qwen для картинок, документов, видео и управления интерфейсами, уже устаревшая: её сменили более новые версии
вышла 1 апреля 2025
Характеристики
- Вышла
- 1 апреля 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 131 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 32 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,20 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0,80 за миллион токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- апрель 2025
- Идентификатор в API
- qwen3-vl-30b-a3b
Что это за модель
Qwen3-VL 30B-A3B — средняя по размеру модель из линейки Qwen3-VL. Эта линейка работает одновременно с текстом и изображениями. Модель построена как смесь экспертов (mixture of experts): всего в ней около 30 млрд параметров, но на каждый токен срабатывает лишь около 3 млрд. Поэтому она отвечает быстрее и обходится дешевле плотной модели того же размера. Qwen выложила её в октябре 2025 года в двух вариантах: Instruct отвечает сразу, Thinking сначала рассуждает.
Линейка Qwen3-VL пришла на смену Qwen2.5-VL. Лаборатория заявляет, что модели стали лучше понимать и писать текст, глубже разбирают изображения, точнее определяют, где находятся предметы и что чем загорожено, и лучше понимают видео. Распознавание текста на картинках теперь поддерживает 32 языка против 19 раньше. В архитектуре появились три новых приёма. Первый по-новому кодирует положение элементов во времени, по ширине и по высоте кадра. Второй, DeepStack, объединяет признаки с нескольких слоёв визуального кодировщика. Третий привязывает текстовые метки времени к кадрам видео. В линейке есть модели от 2B до 235B-A22B, и 30B-A3B стоит в её середине.
Модель берут, чтобы разбирать сканы, документы и диаграммы, отвечать на вопросы по картинкам и видео, писать HTML, CSS, JavaScript и схемы Draw.io по скриншоту или ролику. Qwen отдельно выделяет роль визуального агента: модель распознаёт элементы интерфейса на компьютере или телефоне, понимает, зачем они нужны, вызывает инструменты и доводит задачу до конца.
Веса открыты под лицензией Apache 2.0, так что модель можно запускать на своём оборудовании и использовать в коммерческих проектах. Лаборатория выпускала и версии с квантизацией FP8, то есть с урезанной точностью чисел: такой модели нужно меньше видеопамяти. Сама Qwen с тех пор выпустила много более новых моделей, в том числе Qwen3.5-VL и линейку Qwen3.6. Для новых проектов стоит сравнить эту модель с ними.
Источники: Карточка модели на Hugging Face, Репозиторий Qwen3-VL на GitHub
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).