ИИтак

← Назад

Qwen-Image-2.1 научили раздавать по сети — инструкция есть, кода в vLLM-Omni пока нет

Qwen-Image-2.1 поставили на серверный движок vLLM-Omni: на одной NVIDIA GB300 картинка 1024×1024 выходит за 4,5 секунды при пике памяти 34 ГБ. Поддержка держится на изменении кода, которое ещё не принято в проект.

Изображение: Qwen · X

Qwen-Image-2.1 — модель Alibaba, которая рисует по тексту, правит готовые картинки и умеет отдавать прозрачный фон, — научилась работать под серверным движком vLLM-Omni: он держит очередь запросов и раздаёт результат по сети. На одной NVIDIA GB300 картинка 1024×1024 за 40 шагов получается за 4,5 секунды, пик памяти — 34 ГБ. Сама Qwen поблагодарила проект за поддержку в день выхода модели. Правда, код поддержки ещё не принят в vLLM-Omni и не вошёл ни в один выпуск: инструкция описывает сборку из открытого запроса на изменение.

Модель одна на все задачи: 7,1 млрд параметров в рисующей части плюс Qwen3-VL-8B, который читает запрос и образцы изображений. Отдельной модели для редактирования загружать не нужно — правка идёт тем же путём, что и генерация с нуля. Веса Qwen-Image-2.1 Alibaba открыла накануне.

У сервера свои ограничения. К одному запросу можно приложить не больше четырёх образцов — пятый отклоняется с ошибкой. Настройки по умолчанию расходятся с тем, чего ждёт эта модель: сервер берёт 50 шагов вместо 40 и строгость следования запросу 4.0 вместо выключенной, поэтому оба значения приходится указывать в каждом запросе, иначе вычислений выходит примерно вдвое больше.

Повторные запросы экономят время: если начало запроса совпадает, он обходится примерно в треть от первого, а при четырёх приложенных картинках пересчитать остаётся около пятой части. Стоит поменять хвост запроса — экономия пропадает. Запросы собираются в волны до восьми штук, но новый ждёт, пока текущая волна закончится, даже если место в ней есть.

Перевод весов в формат FP8 на Blackwell даёт память, а не скорость: пик снижается с 41 до 34,4 ГиБ при сжатии текстового кодировщика и до 28,1 ГиБ, если сжать ещё и рисующую часть. Быстрее при этом не становится ни то ни другое.

Авторы инструкции честно перечислили и грабли. Запрос на правку картинки нужно слать формой с файлом, а не JSON: от JSON соединение просто обрывается, и это легко принять за сломанный сервис. Картинку, зашитую прямо в поле формы, сервер принимает только до 1024 КБ, а PNG 512×512 из этой модели весит около мегабайта — то есть почти всегда не проходит. Параллельно поддержку Qwen-Image-2.1 добавил ComfyUI, узловой редактор для локального запуска моделей изображений.

← Все новости