ИИтак

← Назад

IBM и Red Hat запустили GLM-5.2 на 544 картах H100 для 3 000 агентов разом

IBM Research и Red Hat развернули открытую модель GLM-5.2 на видеокартах NVIDIA H100 с помощью своего открытого фреймворка. По их расчётам, токен обходится в 5–10 раз дешевле, чем через коммерческие API.

Открытую модель уровня передовых можно обслуживать на видеокартах прошлого поколения, и это обходится дешевле коммерческих API. К такому выводу пришли IBM Research и Red Hat. Они развернули GLM-5.2 на 544 ускорителях NVIDIA H100 с помощью собственного открытого фреймворка для обслуживания моделей. В GLM-5.2 753 млрд параметров, но на каждом шаге работают около 39 млрд. Система одновременно обслуживала до 3 000 агентов для программирования и ни разу не прервала запрос. В пике она выдавала более 6,6 млн токенов в минуту.

Если арендовать H100 в облаке по нынешним ценам, собственная установка обходится в 5–10 раз дешевле за токен, чем аналогичные коммерческие API. Сильнее всего экономия там, где на вход подаётся много текста, а на выходе получается мало. У агентов так обычно и бывает. Раньше команда уже анализировала 219 реальных сессий Claude Code. Типичный запрос нёс около 195 000 токенов контекста, а ответ занимал всего 317. При этом в 96% запросов основного агента не меньше 90% входа дословно повторяли предыдущий запрос.

Поэтому фреймворк старается не пересчитывать то, что уже посчитано. Запрос уходит на тот сервер, у которого его контекст уже лежит в кэше. Кэш не помещается в память видеокарты и частично хранится в оперативной памяти процессора. Нужный кусок можно забрать и с соседнего сервера. Одни машины только читают контекст, другие только генерируют ответ, и мощности для каждой задачи наращивают отдельно. В итоге 85,2% входных токенов система брала из кэша. На бенчмарке CyberGym точная маршрутизация по кэшу подняла пропускную способность на 79% по сравнению с приблизительной.

«Агентный инференс — это задача системная. Выигрыш дают отказ от лишней работы, маршрутизация к нужному кэшу и раздельное масштабирование, а не только сырая мощность видеокарт», — говорит Карлос Коста, ведущий инженер IBM Research и один из разработчиков проекта. По словам компании, установка уже обслуживает внутреннюю нагрузку IBM. Отдельные бенчмарки команда проводила параллельно с этой нагрузкой.

Фреймворк развивают IBM Research, Red Hat и Google. Он находится в «песочнице» фонда Cloud Native Computing Foundation. Все цифры получили сами авторы фреймворка. Сравнение с API построено на арендных ценах, а не на стоимости владения собственным оборудованием.

← Все новости