ИИтак

← Назад

NVIDIA: Muse Glimmer от Meta помещается в одну видеокарту, от RTX 5090 до Jetson

NVIDIA рассказала, как запускать Muse Glimmer на своём железе. Модель помещается в память одной видеокарты, а на Blackwell Ultra выдаёт больше 20 тысяч токенов в секунду.

Новую открытую модель Meta Muse Glimmer можно целиком запустить на одной видеокарте NVIDIA — от игровой GeForce RTX 5090 до серверной Blackwell Ultra. Модели не нужно дробить между несколькими картами, частично выгружать в оперативную память или отправлять запросы во внешний сервис. Об этом NVIDIA написала в блоге для разработчиков в день выхода модели.

Muse Glimmer — плотная модель на 30 млрд параметров с контекстным окном больше 120 тысяч токенов. Meta сделала её для агентов, которые работают долго и на своём оборудовании. NVIDIA объясняет выбор архитектуры так: при обработке каждого токена работают все параметры, без маршрутизации между «экспертами». По словам компании, поэтому модель точнее выполняет инструкции, не теряет нить в длинном контексте, отвечает с предсказуемой задержкой и реже сбивается в многошаговых задачах.

Самая громкая цифра относится к серверному ускорителю: на Blackwell Ultra модель выдаёт больше 20 тысяч токенов в секунду на одну карту. Памяти при этом остаётся с запасом под кэш длинных диалогов. Для обычных разработчиков NVIDIA называет RTX 5090 с 32 ГБ видеопамяти: код не покидает компьютер, а платить за каждый токен не нужно. Кроме того, модель заявлена для компактной DGX Spark, настольной станции DGX Station для компаний, которым облако запрещено правилами, и для платформы Jetson — роботов и промышленных устройств.

Запустить модель можно несколькими путями. Веса лежат на Hugging Face, для них есть готовые рецепты под открытые движки SGLang и vLLM. Есть и готовый контейнер NVIDIA NIM, который сам подбирает настройки запуска. Попробовать модель без установки можно на build.nvidia.com.

Для дообучения NVIDIA предлагает библиотеку NeMo AutoModel: она работает с весами в формате Hugging Face без конвертации и умеет как полное дообучение, так и облегчённое LoRA. Обучение с подкреплением доступно через NeMo RL. Сравнения с другими моделями по качеству ответов в материале NVIDIA нет, только цифры скорости.

← Все новости