ИИтак

← Назад

Модель · Qwen

Qwen-Image-2.1

Главная открытая модель Qwen для рисования и правки картинок, умеет прозрачный фон и работает на игровой видеокарте

вышла 20 сентября

Характеристики

Вышла
20 сентября
Понимает
текст, изображения
Отвечает
изображения
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
qwen-image-2.1

Что это за модель

Qwen-Image-2.1 — модель Alibaba, которая и рисует картинки по описанию, и редактирует готовые изображения, причём делает это в одном режиме. Qwen называет её своей самой сильной открытой моделью для генерации изображений. Рисует диффузионная часть на 7 млрд параметров: это 32 слоя трансформера, через которые текст и изображение проходят одним общим потоком. Запрос и картинки-образцы читает мультимодальная модель Qwen3-VL на 8 млрд параметров.

Главное нововведение — встроенная прозрачность. Модель сразу выдаёт картинку с прозрачным фоном, может править прозрачные слои и вырезать объект из фотографии. Для этого лаборатория сделала автокодировщик, который хранит прозрачность как отдельный канал. Автокодировщик — это часть модели, которая сжимает картинку перед обработкой и потом восстанавливает её. Ещё модель принимает до 10 картинок-образцов: из них можно собрать новую сцену, сохранив внешность человека или вид товара. Правку можно ограничить областью, если обвести её кружком, подписать или закрыть маской. По словам Qwen, по сравнению с прошлыми версиями модель лучше пишет текст на картинках, точнее передаёт свет на портретах и мелкие детали.

Модель выбирают, когда нужно делать и править картинки на своём оборудовании: для товарных фото, логотипов и наклеек на прозрачном фоне, коллажей из нескольких образцов, точечной правки. Благодаря небольшому размеру она запускается на игровых видеокартах уровня RTX 3090 и 4090. Её с первого дня поддерживают Diffusers, ComfyUI, vLLM-Omni и SGLang. К ней прилагаются две модели-подсказчика. Они превращают короткую или расплывчатую просьбу в подробный запрос.

Компания заявляет, что на собственном бенчмарке модель обходит большинство закрытых моделей, но независимых проверок пока нет. Веса выложены под лицензией Qwen Research License: она разрешает исследования, а для коммерческого применения нужно отдельно получить разрешение у Qwen.

Источники: Карточка модели на Hugging Face, Репозиторий и документация на GitHub

Новости о модели

  1. 01

    Qwen-Image-2.1 на одной RTX 4090 рисует картинку за 18,7 секунды

    Qwen · X

  2. 02

    Qwen выложила подсказчик к Qwen-Image-2.1: из короткой просьбы делает подробный запрос

    Qwen · HF

  3. 03

    Расплывчатую правку — в точный запрос: Qwen выложила модель-подсказчик к Qwen-Image-2.1

    Qwen · HF

  4. 04

    Qwen-Image-2.1 научили раздавать по сети — инструкция есть, кода в vLLM-Omni пока нет

    Qwen · X

  5. 05

    Alibaba открыла Qwen-Image-2.1: рисует с прозрачным фоном и правит обведённое кружком

    Qwen · X

все 5 новостей о Image-2.1 →

Данные: models.dev (MIT).