ИИтак

← Назад

GLM-5.3 читает часть контекста, но держит в памяти весь, пишет SemiAnalysis

Модель GLM-5.3 китайской компании Z.ai при ответе смотрит лишь на часть контекста, но хранит его целиком. По расчётам SemiAnalysis, в зависимости от нужной скорости ответа обслуживать её на ускорителях Nvidia на 47–82% дешевле, чем на AMD.

Разреженное внимание1, на котором построена GLM-5.3 от китайской Z.ai2, уменьшает объём данных, который модель читает на каждом шаге. Память видеокарты оно при этом не освобождает, пишут аналитики SemiAnalysis3 в разборе модели.

от того, сколько памяти требуют модели, зависит рынок высокопропускной памяти4 (HBM) и флеш-памяти для ИИ-серверов. Экономная схема внимания сама по себе этот спрос не снижает: агентам, которые работают долго, по-прежнему нужна вся история диалога.

на каждом новом токене модель сверяется не со всем прошлым текстом, а только с 2 048 самыми важными токенами. Отбирает их лёгкий «индексатор». Эту схему Z.ai взяла у DeepSeek V3.2. Но чтобы сделать выбор, индексатор оценивает весь контекст. Поэтому KV-кэш — сохранённые промежуточные расчёты по каждому прошлому токену — обычно целиком лежит в памяти видеокарты.

команда открытого движка SGLang, через который модели отвечают на запросы пользователей, обходит это ограничение системой HiSparse. Она выгружает части кэша, которые дольше всего не использовались, из памяти видеокарты в обычную оперативную память сервера. Когда индексатор их выбирает, система возвращает их обратно. Так движок выдерживает больше одновременных запросов с длинным контекстом, но платит за это лишними пересылками данных.

замеры SemiAnalysis на ускорителях Nvidia B200 показывают, что происходит, когда одновременных запросов становится 16 вместо 8:

  • Доля повторно использованных токенов запроса, которые берутся из памяти видеокарты, падает с 90,3% до 54,8%.
  • Доля таких токенов из оперативной памяти сервера растёт с 6% до 40,3%, забирая почти всю долю, которую потеряла память видеокарты.
  • Общая доля попаданий в кэш при любой нагрузке держится выше 95%, так что историю почти не приходится пересчитывать заново.

SemiAnalysis оценила, во сколько обходится владение оборудованием и его работа в масштабах крупного облака. В счёт идут все токены, включая историю диалога из кэша. При скорости 150 токенов в секунду на пользователя получается так:

  • Nvidia GB200 обрабатывает миллион токенов примерно за 0,044 доллара, AMD MI355X с движком ATOM — за 0,238 доллара.
  • То есть на GB200 выходит на 82% дешевле, а при скорости 100 и 125 токенов в секунду разрыв меньше — 52% и 62%.
  • Если считать только токены, которые модель сгенерировала, миллион стоит 5,92 доллара на GB200 и 28,52 доллара на MI355X.

в этих замерах первого токена ответа на GB200 приходится ждать до 14–19 секунд, на MI355X — до 1,3–1,7 секунды. Аналитики отдельно сравнили проверенные конфигурации, где ожидание короче двух секунд. В них Nvidia B200 обходится в 0,0666 доллара за миллион токенов, MI355X — в 0,1265 доллара. Nvidia всё равно дешевле, но уже на 47%.

поддержку GLM-5.3 в движке TileRT первой получила AMD MI355X. Этот движок ускоряет ответ одному пользователю, а не увеличивает число одновременных запросов. С ним MI355X выдаёт текст вдвое быстрее, чем в лучшей конфигурации с 4-битными числами, и на 40% быстрее стойки Nvidia GB300 NVL72. Время до первого токена у этой связки аналитики пока называют неоптимальным.

SemiAnalysis предполагает, что GLM-5 проектировали под китайский ускоритель Moore Threads5 MTT S4000. У GLM-5 вдвое меньше «голов» запросов во внимании, чем у DeepSeek V3.2: 64 против 128. По техническому отчёту GLM-5, DeepSeek подбирала это число под Nvidia H800. По расчёту аналитиков, на каждый прочитанный из памяти байт внимание GLM-5 выполняет около 121 операции. Это близко к балансу MTT S4000 — числу операций на байт, при котором чип загружен полностью и не простаивает в ожидании данных из памяти. У MTT S4000 баланс около 128, а у H800 — около 258, вдвое больше, чем у GLM-5. Догадку, по словам SemiAnalysis, подкрепляет сотрудничество Moore Threads с Z.ai: ускорители компании поддержали GLM-5.3-Flash с первого дня.

8 сентября IBM и Red Hat рассказали, как развернули GLM-5.2 на 544 видеокартах H100 для 3 000 агентов, которые пишут код. По их расчёту, токен обошёлся в 5–10 раз дешевле, чем у сопоставимых коммерческих API.

← Все новости