ИИтак

← Назад

Модель · NVIDIA

Nemotron 3 Ultra 550B A55B

Флагманская открытая модель NVIDIA для агентов, сложных рассуждений и анализа очень длинных документов

вышла 4 июня

Характеристики

Вышла
4 июня
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
1 млн токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 65 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,50 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,15 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$2,50 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
nvidia/nemotron-3-ultra-550b-a55b

Что это за модель

Nemotron 3 Ultra — самая крупная модель в линейке Nemotron 3 от NVIDIA. Всего в ней 550 млрд параметров, но на каждый токен работает около 55 млрд. Так устроена смесь экспертов (mixture of experts): модель состоит из множества узких блоков и для каждого фрагмента текста включает лишь часть из них. Архитектура гибридная. Большинство слоёв построено на Mamba-2, которая обрабатывает длинный текст дешевле классического механизма внимания, а слоёв внимания оставлено немного. Модель обучали сразу в сжатом 4-битном формате NVFP4. Встроенные блоки предсказания нескольких токенов позволяют ей использовать спекулятивное декодирование, то есть угадывать сразу несколько следующих слов и этим ускорять ответ.

По сравнению с Nemotron 3 Super это следующая ступень по размеру и точности. После основного обучения модель дообучали на примерах, с подкреплением и методом дистилляции сразу от нескольких моделей-учителей. NVIDIA делает упор на скорость. По замерам компании, в одинаковых условиях Ultra выдаёт текст в 5,9 раза быстрее GLM-5.1, в 4,8 раза быстрее Kimi-K2.6 и в 1,6 раза быстрее Qwen-3.5-397B. По точности, как заявляет NVIDIA, она держится наравне с этими открытыми моделями и обходит их на текстах длиной в миллион токенов.

Модель предназначена для многошаговых агентов, анализа длинных документов, генерации с поиском по базе знаний, программирования и математики. В карточке приведены результаты: 70,7% на SWE-Bench Verified, 86,8% на MMLU-Pro, 89,0% на LiveCodeBench v6 и 94,7% на RULER при контексте в миллион токенов. Рассуждения можно настроить: включить полностью, выключить ради быстрых прямых ответов, выбрать средний режим или задать жёсткий лимит токенов на размышления. Официально поддержаны десять языков, среди них английский, французский, немецкий, японский и китайский. Русского в этом списке нет.

Веса распространяются по лицензии OpenMDW 1.1, она разрешает коммерческое использование. Запустить модель у себя сложно. Для полной версии нужен сервер с восемью ускорителями B200 или несколько узлов с H100, а суммарно около 1,5 ТБ видеопамяти. Основное обучение модели шло на данных до сентября 2025 года, поэтому о более поздних событиях она может не знать.

Источники: Страница модели в разделе исследований NVIDIA, Карточка модели на Hugging Face

Другие модели семейства

Новости о модели

  1. 01

    Натан Ламберт рассказал Конгрессу, насколько Китай обогнал США в открытых моделях

    Interconnects

  2. 02

    Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

    Яндекс

  3. 03

    Яндекс выложил открытую базовую модель AliceAI-Foundation на 80 млрд параметров

    Яндекс · HF

  4. 04

    NVIDIA на примере Nemotron 3.5 Lightning объяснила, когда смесь экспертов лучше плотной модели

    NVIDIA для разработчиков

  5. 05

    NVIDIA ускорила Nemotron 3 Ultra в NIM: на четырёх B200 помещается в 2,5 раза больше пользователей

    NVIDIA для разработчиков

  6. 06

    NVIDIA научила малую модель Nemotron распределять дефицитные детали как опытные плановики

    NVIDIA для разработчиков

все 17 новостей о Nemotron 3 →

Данные: models.dev (MIT).