Nunchux генерирует 5 секунд видео MiniMax-H3 за 1,33 секунды на чипах AMD
На восьми ускорителях AMD Instinct MI355X стартап обогнал открытый движок SGLang в 21,8–26,7 раза. Сюжет ролика можно менять новым запросом прямо во время просмотра.
Стартап Nunchux запустил видеомодель MiniMax-H3 на сервере с восемью ускорителями AMD Instinct MI355X1, сообщила компания в блоге. Пятисекундный ролик со звуком такой сервер делает за 1,33 секунды. На 15-секундный уходит 5,39 секунды. На четырёх ускорителях любой проверенный ролик тоже готов быстрее, чем длится: 15 секунд видео — за 10,52 секунды.
«Приятно видеть, как оптимизация модели и инженерная работа по её запуску на AMD объединяются и дают авторам более быструю обратную связь», — написали в MiniMax, разработчике модели, процитировав пост Nunchux в соцсети X.
Nunchux — стартап из Сан-Франциско, который делает инфраструктуру для быстрого запуска моделей для картинок и видео. Его основали выходцы из лаборатории HAN Lab MIT и Лаборатории генеративного интеллекта Университета Карнеги — Меллон. Компания вышла из тени 3 сентября. По её данным, метод сжатия моделей SVDQuant, созданный в этих лабораториях, скачали 4 млн раз.
Сравнение с открытым движком SGLang2 компания проводила на тех же ускорителях. На восьми AMD Instinct MI355X Nunchux делал ролики в 21,8–26,7 раза быстрее. Базовый вариант на SGLang запускал MiniMax-H3 в 16-битной точности BF16 и за 50 шагов генерации. В замер вошли обработка текстового запроса, расшумление и декодирование видео и звука, но не упаковка в MP4. Какие настройки использовал сам Nunchux, в блоге не уточняется. По оценке компании, на одинаковых запросах качество изображения сопоставимо.
Ускорения стартап добивается тремя способами: дообучает модель, оптимизирует её и запускает на собственном движке инференса. Так называют программу, которая исполняет уже обученную модель и по запросу выдаёт готовый результат. Модель и движок компания подгоняет под конкретное оборудование. AMD Instinct MI355X выбрали из-за 288 ГБ памяти и встроенной поддержки 6-битного формата MXFP63. В нём ускоритель выдаёт до 10,1 петафлопса, примерно вдвое больше пика в формате FP8. Собственное ядро4 Nunchux для MXFP6 в тестах компании работает примерно в 13 раз быстрее стандартной реализации из библиотек AMD.
Видео получается быстрее, чем воспроизводится, поэтому в демоверсии следующий фрагмент генерируется, пока зритель смотрит текущий. Запрос можно поменять прямо во время просмотра, и следующий фрагмент пойдёт уже по новому описанию.
Бесплатный доступ к MiniMax-H3 на своей платформе Nunchux Modelverse компания обещает «совсем скоро» и уже собирает лист ожидания. Точную дату она не назвала.
Ранее, 14 сентября, Nunchux вместе с исследователями из MIT, CMU, Беркли, Стэнфорда и NVIDIA показала метод VC-Attention: он ускорил механизм внимания MiniMax-H3 в 1,5–1,6 раза. 14 сентября MiniMax сообщала и о другой ускоренной версии модели — VDN-H3 от сторонней команды разработчиков. Вместе с SGLang она на восьми NVIDIA B200 делает 14,4 секунды видео за 9 секунд.