Liquid AI ускорила малые модели LFM2.5 до 3,2 раза с помощью черновых моделей DSpark
Liquid AI выпустила черновые модели DSpark для трёх моделей LFM2.5. На H100 генерация ускоряется до 3,18 раза, на MacBook — до 2,87 раза, а ответы остаются теми же.
Liquid AI научила свои малые модели LFM2.5 отвечать заметно быстрее, не меняя сами ответы. Компания выпустила черновые модели DSpark для LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B. На видеокарте H100 генерация ускоряется до 3,18 раза, на ноутбуке MacBook Pro с чипом M4 Max — до 2,87 раза.
Приём называется спекулятивным декодированием. Когда модель пишет текст, основное время уходит не на вычисления, а на то, чтобы подгрузить веса из памяти для каждого нового токена. Маленькая черновая модель быстро предлагает сразу несколько следующих токенов, а большая проверяет их за один проход. Всё, что не совпало с её собственным выбором, она заменяет своим токеном. Поэтому в режиме без случайности (температура 0) итоговый текст совпадает с тем, что модель написала бы без помощника, и результаты на бенчмарках не меняются.
Черновики у Liquid AI небольшие, около 300 млн параметров каждый: пять слоёв внимания, за раз предлагают девять токенов. Метод DSpark объединяет параллельную генерацию черновика, лёгкий блок, который учитывает связь соседних токенов, и проверяющий модуль. Тот отбрасывает ненадёжный хвост черновика, если проверка обойдётся дороже, чем сэкономит. Среди версий обучения компания выбирала ту, чьи токены основная модель принимала чаще всего, а не ту, у которой меньше ошибка на обучении.
Выигрыш неравномерный. Для LFM2.5-2.6B вызовы внешних инструментов в сценариях с несколькими инструментами стали в среднем на 57% быстрее — компания делает ставку на агентов, которые работают прямо на устройстве. У LFM2.5-1.2B-Instruct ускорение колеблется до 52% в зависимости от типа текста. А LFM2.5-8B-A1B на ноутбуке ускорилась в среднем лишь на 18%. Причину компания видит в том, как llama.cpp пока исполняет модели со смесью экспертов на Mac, и в том, что проверка нескольких токенов сразу задействует больше экспертов, а значит, требует больше чтения из памяти.
Черновые модели лежат на Hugging Face в форматах Safetensors и GGUF. Их можно запустить в llama.cpp и SGLang, но пока только через сборки с ещё не принятыми изменениями кода. Все замеры компания сделала сама, с одним запросом за раз. Как метод поведёт себя под нагрузкой из множества пользователей, в материале не сказано.