Разреженное внимание
Разреженное внимание (sparse attention) — разновидность механизма внимания, при которой каждый токен учитывает не все токены контекста, а только их часть: соседей в окне, токены по заданному шаблону или фрагменты, отобранные как самые значимые. Так снижается квадратичная стоимость вычислений, и модели легче работать с длинными последовательностями. Линейное внимание заменяет саму формулу внимания приближением, а разреженное сохраняет обычное внимание, но пропускает часть пар токенов.
проверено по: arxiv.org ↗
В новостях
GLM-5.3 читает часть контекста, но держит в памяти весь, пишет SemiAnalysis
Разреженное внимание (sparse attention) — способ, при котором модель на каждом шаге обращается не ко всему контексту, а к отобранным его частям. Вычислений и чтения данных становится меньше, но сам контекст обычно по-прежнему хранится в памяти.