ИИтак

← Назад

Метод VC-Attention ускорил механизм внимания видеомодели MiniMax-H3 в 1,6 раза

Стартап Nunchux AI и исследователи из MIT, CMU, Беркли, Стэнфорда и NVIDIA показали VC-Attention — способ считать внимание в 8 битах без переобучения модели. На MiniMax-H3 этот этап работает в 1,5–1,6 раза быстрее.

Стартап Nunchux AI вместе с исследователями из MIT, CMU, UC Berkeley, Stanford и NVIDIA представил VC-Attention — метод, который ускоряет механизм внимания в видеомоделях за счёт вычислений в пониженной точности. Модель при этом не нужно переобучать. Проверяли метод на открытой видеомодели MiniMax-H3. Сама MiniMax заметила работу и 18 сентября поблагодарила авторов у себя в X.

Почему взялись именно за внимание: по подсчётам Nunchux, при генерации в H3 на одном ускорителе NVIDIA B200 с библиотекой FlashAttention-4 в 16-битном формате BF16 примерно две трети каждого шага очистки от шума уходит на этот механизм. Его стоимость растёт пропорционально квадрату числа токенов, поэтому чем длиннее ролик, тем сильнее он тормозит всю генерацию. Замеры проводили на 10-секундных клипах: 243 кадра в разрешении 1344×768.

Результаты такие. На B200 ядро внимания работает в 1,59 раза быстрее, чем FlashAttention-4 в BF16, на B300 — в 1,5 раза. Речь именно о внимании, а не обо всей генерации ролика. По качеству метод обошёл популярный SageAttention2: на 100 запросах среднее пиковое отношение сигнала к шуму по сравнению с эталонным 16-битным результатом составило 20,2 дБ против 19,9 дБ. Коммерческая версия метода, Nunchux Attention, которую компания держит закрытой, даёт ускорение в 1,91 раза на B200 и в 1,83 раза на B300.

Метод держится на двух приёмах. Первый, V-Smooth, борется с ошибками округления в матрице значений: существующие методы уже научились аккуратно считать в низкой точности произведение запросов и ключей, и главным источником погрешности остались именно значения. V-Smooth с помощью лёгкой кластеризации k-means собирает похожие токены в один аппаратный блок, вычитает из них среднее по блоку и в низкую точность переводит только остаток. По данным отчёта, на четырёх моделях это само по себе добавляет от 1,1 до 2,8 дБ пикового отношения сигнала к шуму по сравнению с SageAttention2. На B200 V-Smooth включают только на первую четверть шагов очистки от шума.

Второй приём, ExpCast-FP8, ускоряет софтмакс. Перемножение матриц в 8 битах становится быстрым, а софтмакс между двумя перемножениями по-прежнему считается в высокой точности и превращается в самый долгий этап. Вместо того чтобы вычислять экспоненту в 32-битном формате и затем переводить её в FP8, ExpCast-FP8 получает нужный байт FP8 одной линейной формулой с округлением. Это приближение, но оно заметно дешевле.

Авторы подчёркивают, что VC-Attention совместим с разреженным вниманием, дистилляцией в малое число шагов и запуском на нескольких GPU, так что эти способы удешевить генерацию можно складывать. MiniMax в своём посте разложила способы ускорить внимание на три пути: считать те же взаимодействия эффективнее, полностью считать только часть из них или по-другому смешивать информацию. Компания предположила, что сочетание 8-битных вычислений с разреженными методами вроде Sol-Attn может дать ещё больший выигрыш. Пока это только гипотеза: в статье такую связку не проверяли.

Для H3 это уже не первая доработка от сторонних разработчиков: сообщество продолжает ускорять открытую модель. Nunchux также пообещала вскоре открыть бесплатный доступ к MiniMax-H3 на своей платформе Nunchux Modelverse, записаться туда можно через лист ожидания. Сроков компания не назвала.

← Все новости