Модель · NVIDIA
Nemotron 3 Ultra 550B A55B
Флагманская открытая модель NVIDIA для агентов, сложных рассуждений и анализа очень длинных документов
вышла 4 июня
Характеристики
- Вышла
- 4 июня
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 1 млн токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 65 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,50 за миллион токенов
- Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
- $0,15 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $2,50 за миллион токенов
- Понимает
- текст
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- nvidia/nemotron-3-ultra-550b-a55b
Что это за модель
Nemotron 3 Ultra — самая крупная модель в линейке Nemotron 3 от NVIDIA. Всего в ней 550 млрд параметров, но на каждый токен работает около 55 млрд. Так устроена смесь экспертов (mixture of experts): модель состоит из множества узких блоков и для каждого фрагмента текста включает лишь часть из них. Архитектура гибридная. Большинство слоёв построено на Mamba-2, которая обрабатывает длинный текст дешевле классического механизма внимания, а слоёв внимания оставлено немного. Модель обучали сразу в сжатом 4-битном формате NVFP4. Встроенные блоки предсказания нескольких токенов позволяют ей использовать спекулятивное декодирование, то есть угадывать сразу несколько следующих слов и этим ускорять ответ.
По сравнению с Nemotron 3 Super это следующая ступень по размеру и точности. После основного обучения модель дообучали на примерах, с подкреплением и методом дистилляции сразу от нескольких моделей-учителей. NVIDIA делает упор на скорость. По замерам компании, в одинаковых условиях Ultra выдаёт текст в 5,9 раза быстрее GLM-5.1, в 4,8 раза быстрее Kimi-K2.6 и в 1,6 раза быстрее Qwen-3.5-397B. По точности, как заявляет NVIDIA, она держится наравне с этими открытыми моделями и обходит их на текстах длиной в миллион токенов.
Модель предназначена для многошаговых агентов, анализа длинных документов, генерации с поиском по базе знаний, программирования и математики. В карточке приведены результаты: 70,7% на SWE-Bench Verified, 86,8% на MMLU-Pro, 89,0% на LiveCodeBench v6 и 94,7% на RULER при контексте в миллион токенов. Рассуждения можно настроить: включить полностью, выключить ради быстрых прямых ответов, выбрать средний режим или задать жёсткий лимит токенов на размышления. Официально поддержаны десять языков, среди них английский, французский, немецкий, японский и китайский. Русского в этом списке нет.
Веса распространяются по лицензии OpenMDW 1.1, она разрешает коммерческое использование. Запустить модель у себя сложно. Для полной версии нужен сервер с восемью ускорителями B200 или несколько узлов с H100, а суммарно около 1,5 ТБ видеопамяти. Основное обучение модели шло на данных до сентября 2025 года, поэтому о более поздних событиях она может не знать.
Источники: Страница модели в разделе исследований NVIDIA, Карточка модели на Hugging Face
Другие модели семейства
-
Nemotron 3.5 Lightning 30B A3B
NVIDIAконтекст 262 тыс.бесплатнооткрытые весарассуждения
-
Nemotron 3 Nano Omni
NVIDIAконтекст 256 тыс.бесплатнооткрытые весарассуждения
-
Nemotron 3 Super
NVIDIAконтекст 262 тыс.$0,20 / $0,80открытые весарассуждения
-
nemotron-3-nano-30b-a3b
NVIDIAконтекст 131 тыс.бесплатнооткрытые весарассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).