Словарь
SageAttention2
Метод ускорения механизма внимания при работе уже обученных моделей: часть матричных вычислений выполняется в пониженной точности (4-битные целые числа и 8-битные числа с плавающей запятой). Специальные приёмы сглаживания и накопления сохраняют точность. Метод подключается к готовым языковым моделям и генераторам изображений и видео без переобучения и заметно обгоняет FlashAttention2 по скорости.