ИИтак

← Назад

Qwen-Image-2.1 на одной RTX 4090 рисует картинку за 18,7 секунды

Команда SGLang подключила Qwen-Image-2.1 к своему движку SGLang Diffusion. На игровой RTX 4090 модель рисует картинку 1024×1024 за 18,7 секунды, правит изображение за 21,7 секунды и обходится без сжатия весов. Демо можно открыть в браузере.

Модель Alibaba для рисования и правки картинок Qwen-Image-2.1 работает на домашней видеокарте в полной точности. Разработчики серверного движка SGLang Diffusion подключили её в день выхода. На RTX 4090 с 24 ГБ памяти картинка 1024×1024 получается за 18,7 секунды, правка — за 21,7 секунды. Для этого часть данных приходится держать в оперативной памяти компьютера, а видеопамять в пике занята на 22,7 ГБ.

На профессиональной RTX PRO 6000 с 96 ГБ те же задачи занимают 8 и 9,6 секунды. Замеряли при 40 шагах генерации, по одной картинке на запрос и без квантизации, то есть веса не сжимали ради экономии памяти. SGLang Diffusion умеет выдавать PNG с прозрачным фоном, править изображение по нескольким картинкам сразу, подключать LoRA и отвечать через API в формате OpenAI. Для разных видеокарт команда выложила готовые команды запуска.

Qwen тем временем открыла демо в браузере на Hugging Face Spaces, устанавливать ничего не нужно. Команда напоминает, что генерация и правка живут в одной модели. Qwen-Image-2.1 вышла накануне: в генеративной части у неё 7 млрд параметров, она принимает до 10 картинок-образцов и работает в связке с отдельными моделями, которые переписывают запросы. Раньше её уже поставили на другой серверный движок, vLLM-Omni, но там изменения кода пока не приняли в проект.

← Все новости