SemiAnalysis перенесла часть модели DeepSeek V4.1-Flash из видеопамяти в ОЗУ. Почему это важно
Engram — часть DeepSeek V4.1-Flash, таблица из готовых векторов для частых сочетаний токенов, около 189 ГиБ. После её переноса в оперативную память копии модели на B300 хватило двух ускорителей вместо четырёх. Выгрузка на SSD оказалась невыгодной.
Таблицу модуля Engram в DeepSeek V4.1-Flash можно хранить не в высокопропускной памяти1 (HBM) ускорителей, а в обычной оперативной памяти сервера, и скорость от этого не падает, выяснили аналитики SemiAnalysis. На ускорителях NVIDIA B300 на одну копию модели понадобилось меньше GPU, обмена данными между ними стало меньше, а производительность выросла до 1,6 раза.
«При одинаковом качестве модели HBM нужно меньше, поскольку таблицы Engram можно выгрузить в оперативную память сервера. Поэтому пропускная способность HBM значит куда больше, чем её объём», — считают авторы отчёта. По их словам, в инференсе лучшее соотношение цены и пропускной способности, а значит и самую низкую цену токена, дают стеки HBM из четырёх слоёв.
SemiAnalysis — американская аналитическая компания, которая изучает рынок полупроводников и инфраструктуру ИИ. Она ведёт открытый бенчмарк InferenceX, который замеряет скорость и стоимость работы моделей на ускорителях NVIDIA, AMD, Google и других производителей.
Engram — модуль памяти, который DeepSeek описала в январе 2026 года и применила в V4.1-Flash, вышедшей 10 сентября. Модель заучивает векторы для частых сочетаний токенов и берёт их из таблицы готовыми, по номерам самих токенов. Раз готовый вектор уже лежит в таблице, модели реже приходится заново вычислять его в обычных слоях нейросети. Адрес нужной строки известен заранее, так что её можно подгрузить из оперативной памяти, пока ускоритель считает предыдущие слои.
Таблица большая, около 189 ГиБ, а обращения к ней небольшие: на одну позицию текста V4.1-Flash запрашивает по 24 строки в двух слоях Engram, всего около 12,4 КиБ. На B300 возврат таблицы в HBM выигрыша не дал: результаты остались в пределах разброса между прогонами. Без таблицы в видеопамяти одной копии модели хватило двух GPU вместо четырёх, а освободившееся место можно отдать под KV-кэш2 и, возможно, обслуживать больше сеансов одновременно.
На B200 аналитики пошли дальше и вынесли таблицы в файлы на локальных SSD. Для этого они использовали неоптимизированную версию vLLM3. При скорости около 125 токенов в секунду на пользователя вариант с оперативной памятью дал 121 млн токенов на доллар, а вариант с SSD — 52 млн. «Более дешёвое хранилище не делает автоматически дешевле сервис инференса», — пояснили в SemiAnalysis. В этом опыте модель работала на четырёх дорогих ускорителях B200, и перенос таблицы на SSD оставил на месте и их, и остальной сервер.
Авторы проверили, какие сочетания V4.1-Flash охотнее всего берёт из таблицы. Это оказались имена, фрагменты кода, фразы о связях между понятиями и шаблонный текст вроде лицензий. Одной из неожиданных находок стала связка «Wright : Ace Attorney» из названия видеоигры. Без Engram модель хуже предсказывает текст во всех проверенных областях, особенно в энциклопедических статьях и коде. При этом точность на школьных математических задачах GSM8K не изменилась.
На бенчмарке CRUXEval модель предсказывает, что вернёт короткая функция на Python. Без Engram ошибка предсказания эталонного ответа там выросла с 0,2848 до 0,3093 бита на токен. Если при этом заставить модель выбирать тех же экспертов, что и с Engram, ошибка растёт до 0,3375 бита. «Engram — не съёмный словарь рядом с неизменной смесью экспертов4», — подчеркнули авторы: без памяти модель отправляет токены к другим экспертам и отчасти восполняет потерю.