NVIDIA ускорила Nemotron 3 Ultra в NIM: на четырёх B200 помещается в 2,5 раза больше пользователей
Готовый контейнер NIM 2.0.12 с моделью Nemotron 3 Ultra на сервере с четырьмя B200 выдаёт до 2,5 раза больше токенов в секунду, чем открытый сервер без этих настроек. Каждый пользователь при этом получает 50 токенов в секунду.
Если запускать модель Nemotron 3 Ultra в фирменном контейнере NVIDIA NIM1, один сервер обслужит в 2,5 раза больше пользователей, чем без него. Так говорит собственный замер NVIDIA. Сервер был с четырьмя ускорителями B2002, а для сравнения взяли открытый сервер для запуска моделей без оптимизаций NVIDIA.
Условия теста компания подобрала под работу ИИ-агентов. Запрос длиной около 64 тысяч токенов, ответ — 400 токенов, и 76% контекста повторяется от шага к шагу. Каждый пользователь должен получать не меньше 50 токенов в секунду, то есть новое слово примерно каждые 20 миллисекунд. При таком темпе NIM 2.0.12 выдал всем пользователям вместе почти 2 000 токенов в секунду.
Прирост дала не одна настройка, а сразу несколько. NVIDIA подогнала вычислительные ядра под гибридную архитектуру модели: в ней есть слои смеси экспертов и слои Mamba3. Модель разделили на четыре ускорителя. Повторяющийся контекст берётся из кэша, а не считается заново, причём кэш помогает, даже если совпадает только часть запроса. Кроме того, NVIDIA настроила планировщик и распределение памяти. Последний слой — спекулятивное декодирование MTP4: модель заранее предлагает несколько следующих токенов, а потом проверяет их. В NVIDIA предупреждают, что эффекты не складываются арифметически. Сколько даёт MTP, зависит от того, какая доля догадок подтверждается и сколько свободной памяти остаётся.
Сам NIM — это готовый микросервис с моделью, проверенными настройками под конкретную связку модели и ускорителя и стандартным API. Платная версия NIM Certified входит в NVIDIA AI Enterprise. Она добавляет регулярные обновления, исправления уязвимостей и коммерческую поддержку.
Компания оговаривается: опубликованные цифры — точка отсчёта, а не обещание. Свою нагрузку NVIDIA советует прогнать через инструмент AIPerf и выбрать настройку, которая укладывается в нужную задержку. Стоит помнить, что и тест, и базовую конфигурацию для сравнения выбирала сама NVIDIA. Готовые оптимизированные конфигурации компания обещает и для других моделей.