ИИтак

← Назад

Модель · NVIDIA

Nemotron 3 Super

Средняя модель линейки Nemotron 3 от NVIDIA с открытыми весами, для агентов, программирования и потоков рассуждений в больших объёмах

вышла 11 марта

Характеристики

Вышла
11 марта
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
262 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 262 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,20 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,80 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
апрель 2024
Идентификатор в API
nvidia/nemotron-3-super-120b-a12b

Что это за модель

Nemotron 3 Super — вторая модель линейки Nemotron 3 от NVIDIA. По размеру она стоит между малой Nano и крупной Ultra. Всего в ней 120 млрд параметров, но на каждый токен работают только 12 млрд. Так устроена смесь экспертов (mixture of experts): модель состоит из многих подсетей-«экспертов» и для каждого токена включает лишь часть из них. Архитектура гибридная. Слои Mamba-2 экономно обрабатывают длинный текст, а отдельные слои внимания, как у обычных трансформеров, помогают точно находить нужное место в контексте.

NVIDIA добавила в модель несколько новых решений. Первое — LatentMoE: перед отправкой к экспертам токен сжимается, поэтому за те же вычисления модель может задействовать вчетверо больше экспертов. Второе — предсказание сразу нескольких следующих токенов: по данным компании, на структурированных ответах это ускоряет генерацию до трёх раз. Третье — модель с самого начала обучали в 4-битном формате NVFP4, а не сжимали после обучения. Компания заявляет, что пропускная способность выросла в пять раз по сравнению с прошлой Nemotron Super. При длинных ответах модель, по замерам NVIDIA, выдаёт в 2,2 раза больше токенов в секунду, чем GPT-OSS-120B, и в 7,5 раза больше, чем Qwen3.5-122B.

NVIDIA делала модель для систем из нескольких агентов. По словам компании, такие системы порождают в 15 раз больше токенов, чем обычный чат, и запускать на каждой подзадаче самую крупную модель слишком дорого и долго. Типичные задачи для Super — разбор заявок в IT-поддержке, генерация с поиском по документам, программирование и сложные рассуждения. В анонсе NVIDIA приводит такие результаты: 85,6% на PinchBench (тест на работу модели в роли «мозга» автономного агента), 60,47% на SWE-Bench в среде OpenHands, 90,21 на AIME25 и 83,73 на MMLU-Pro. Рассуждения перед ответом можно выключить, перевести в облегчённый режим или ограничить заданным числом токенов.

Сама модель, по заявлению лаборатории, работает с контекстом до миллиона токенов: на тесте RULER при такой длине её точность 91,75%. У провайдеров API лимит может быть ниже. Дообучение делали на семи языках: английском, французском, немецком, итальянском, японском, испанском и китайском. Русского среди них нет. Веса, обучающие наборы данных и рецепты обучения выложены открыто под лицензией NVIDIA Nemotron Open Model License, она разрешает коммерческое применение.

Источники: Анонс в техническом блоге NVIDIA, Карточка модели на Hugging Face

Другие модели семейства

Новости о модели

  1. 01

    Натан Ламберт рассказал Конгрессу, насколько Китай обогнал США в открытых моделях

    Interconnects

  2. 02

    Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

    Яндекс

  3. 03

    Яндекс выложил открытую базовую модель AliceAI-Foundation на 80 млрд параметров

    Яндекс · HF

  4. 04

    NVIDIA на примере Nemotron 3.5 Lightning объяснила, когда смесь экспертов лучше плотной модели

    NVIDIA для разработчиков

  5. 05

    NVIDIA ускорила Nemotron 3 Ultra в NIM: на четырёх B200 помещается в 2,5 раза больше пользователей

    NVIDIA для разработчиков

  6. 06

    NVIDIA научила малую модель Nemotron распределять дефицитные детали как опытные плановики

    NVIDIA для разработчиков

все 17 новостей о Nemotron 3 →

Данные: models.dev (MIT).