Модель · Qwen
Qwen-Image-2.1
Главная открытая модель Qwen для рисования и правки картинок, умеет прозрачный фон и работает на игровой видеокарте
вышла 20 сентября
Характеристики
- Вышла
- 20 сентября
- Понимает
- текст, изображения
- Отвечает
- изображения
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- qwen-image-2.1
Что это за модель
Qwen-Image-2.1 — модель Alibaba, которая и рисует картинки по описанию, и редактирует готовые изображения, причём делает это в одном режиме. Qwen называет её своей самой сильной открытой моделью для генерации изображений. Рисует диффузионная часть на 7 млрд параметров: это 32 слоя трансформера, через которые текст и изображение проходят одним общим потоком. Запрос и картинки-образцы читает мультимодальная модель Qwen3-VL на 8 млрд параметров.
Главное нововведение — встроенная прозрачность. Модель сразу выдаёт картинку с прозрачным фоном, может править прозрачные слои и вырезать объект из фотографии. Для этого лаборатория сделала автокодировщик, который хранит прозрачность как отдельный канал. Автокодировщик — это часть модели, которая сжимает картинку перед обработкой и потом восстанавливает её. Ещё модель принимает до 10 картинок-образцов: из них можно собрать новую сцену, сохранив внешность человека или вид товара. Правку можно ограничить областью, если обвести её кружком, подписать или закрыть маской. По словам Qwen, по сравнению с прошлыми версиями модель лучше пишет текст на картинках, точнее передаёт свет на портретах и мелкие детали.
Модель выбирают, когда нужно делать и править картинки на своём оборудовании: для товарных фото, логотипов и наклеек на прозрачном фоне, коллажей из нескольких образцов, точечной правки. Благодаря небольшому размеру она запускается на игровых видеокартах уровня RTX 3090 и 4090. Её с первого дня поддерживают Diffusers, ComfyUI, vLLM-Omni и SGLang. К ней прилагаются две модели-подсказчика. Они превращают короткую или расплывчатую просьбу в подробный запрос.
Компания заявляет, что на собственном бенчмарке модель обходит большинство закрытых моделей, но независимых проверок пока нет. Веса выложены под лицензией Qwen Research License: она разрешает исследования, а для коммерческого применения нужно отдельно получить разрешение у Qwen.
Источники: Карточка модели на Hugging Face, Репозиторий и документация на GitHub
Новости о модели
- 01
- 02
- 03
- 04
- 05
Данные: models.dev (MIT).