ИИтак

← Назад

SemiAnalysis выделила в работе серверов для ИИ-агентов режим «дозаполнения». Почему это важно

Агент дописывает сотни или тысячи токенов к контексту длиной в сотни тысяч. Под такие запросы может понадобиться отдельная группа серверов, считают аналитики.

Аналитики SemiAnalysis Тандж Беннетт, Брайан Шань и Дилан Пател предлагают различать на серверах для ИИ-агентов не два режима работы, а четыре. Об этом они пишут в статье. Главное новшество их схемы — «дозаполнение»: новый ход разговора дописывается к длинному контексту, который сервер уже обработал раньше.

Обычно работу модели делят надвое. При предзаполнении она разом читает запрос и сохраняет промежуточные расчёты в KV-кэш1. При декодировании она пишет ответ по одному токену и каждый раз перечитывает этот кэш. Декодирование авторы делят ещё на две части. Сначала механизм внимания сверяет новый токен со всем прежним контекстом — для этого и читается кэш. Потом токен дорабатывают «эксперты» — отдельные блоки весов модели, которым контекст уже не нужен. В моделях со смесью экспертов таких блоков сотни в каждом слое, но на каждый токен включаются лишь несколько.

«Дозаполнение — не маленькое предзаполнение и не большое декодирование», — поясняют авторы. Новый ход обычно добавляет от 50 до 5 000 токенов к контексту, который часто длиннее 100 тыс. токенов. Сервер читает кэш в десятки гигабайт, как при декодировании, но обрабатывает сразу пачку новых токенов, как при предзаполнении.

SemiAnalysis — американская аналитическая компания, которая изучает полупроводники и инфраструктуру ИИ. Пател — её основатель. Авторы, в частности, изучили записи сессий агентов из набора AgentX. В них видно, как модели Anthropic сжимают контекст, когда он подходит к практическому пределу: у Claude Opus 4.8 это около 250 тыс. токенов, у Fable — около 1 млн.

Модель на сервере часто разрезают по слоям между группами видеокарт, и запросы проходят эти группы по очереди, как по конвейеру. На каждом участке запросы обрабатываются не поодиночке, а пакетами — по нескольку вместе. Дозаполнение занимает свой участок намного дольше, чем пакеты декодирования занимают соседние, и соседние участки из-за этого остаются недогруженными. Поэтому авторы допускают, что под дозаполнение стоит держать отдельную группу серверов. Оборудование в ней может быть тем же, но модель в ней иначе распределена между видеокартами, а пакеты запросов собираются по другим правилам.

Декодированию большие пакеты запросов помогают слабо, считают авторы. Пакет выгоден, когда веса, один раз прочитанные из памяти, обрабатывают сразу много токенов. Но каждый запрос приносит свой кэш, и читать его приходится отдельно. А токен выбирает лишь 8–16 из сотен экспертов слоя, поэтому в небольшом пакете большинство включённых экспертов получают всего по одному токену. Токенов, которым нужен один и тот же эксперт, с ростом пакета становится больше лишь постепенно. Оптимальный пакет, по их оценке, может быть ближе к одному–пяти запросам. «Многократно увеличивать задержку ради небольшого прироста пропускной способности — возможно, плохая сделка», — предупреждают они.

Высокопропускную память2 (HBM) на видеокартах авторы советуют занимать только данными, которые обрабатываются прямо сейчас. Кэш законченного хода нужно сразу переносить в память процессоров и на SSD. Свой подход они проверили на модели Kimi K3: смоделировали её работу на системах NVIDIA B200, B300 и GB200, в которых от 16 до 64 видеокарт. В большинстве оптимальных конфигураций каждой видеокарте хватило меньше 80 ГБ. Отсюда вывод авторов: скорость памяти может быть ценнее её объёма.

«Данные, которые лежат в памяти без дела, — это расход, данные, которые движутся на обработку, — выручка»

авторы статьи SemiAnalysis

В середине сентября стойка NVIDIA Vera Rubin NVL72 впервые прошла тесты MLPerf3 и работала в них до 3,7 раза быстрее GB300 NVL72 — стойки NVIDIA прошлого поколения. Авторы оценивают её так: на дозаполнении, где много вычислений, она очень сильна. На декодировании всё упирается в память, и там она не может полностью задействовать свою вычислительную мощь.

← Все новости