Расплывчатую правку — в точный запрос: Qwen выложила модель-подсказчик к Qwen-Image-2.1
Qwen открыла Qwen-Image-2.1-PE-I2I — модель, которая берёт невнятную команду на правку и картинку и переписывает их в подробный запрос для редактора изображений. Это дообученная Qwen3.5-VL на 9 млрд параметров.
Alibaba выложила на Hugging Face небольшую модель, которая работает переводчиком между человеком и редактором картинок. Qwen-Image-2.1-PE-I2I принимает расплывчатую инструкцию на правку вместе с исходным изображением и переписывает её в подробный запрос, понятный модели редактирования. В основе — дообученная Qwen3.5-VL на 9 млрд параметров, то есть модель, которая умеет смотреть на картинку, а не только читать текст.
Отвечает она не свободным текстом. Сначала идёт блок рассуждений, затем — структурированный ответ в формате JSON: сам переписанный запрос и соотношение сторон. Либо модель выбирает пропорции сама, например 16:9, если создаётся новая композиция, либо помечает, что пропорции нужно взять у исходного изображения, когда правка идёт поверх него. Одновременно и то и другое выдать нельзя.
На вход можно подать несколько картинок сразу — в запросе они обозначаются по номерам. Запускается модель через библиотеку Transformers, а результат её работы передаётся дальше в саму Qwen-Image-2.1 через Diffusers. Рядом Qwen выложила такую же модель-подсказчик для генерации по тексту.
Сама Qwen-Image-2.1 вышла в тот же день: 7 млрд параметров в визуальной части, 32 слоя Single-Stream DiT, до 10 референсных изображений, прозрачный фон RGBA и правки по обведённым кругам, пометкам поверх картинки или отдельным маскам. По словам разработчиков, лёгкая архитектура с разной степенью детализации внимания и повторным использованием кэша даёт хорошее качество при небольших вычислительных затратах.
Лицензия у подсказчика исследовательская — Qwen Research License Agreement, а не привычная для многих моделей Qwen открытая Apache 2.0. На бесплатное коммерческое применение она не рассчитана.