Модель · NVIDIA
Nemotron 3 Super
Средняя модель линейки Nemotron 3 от NVIDIA с открытыми весами, для агентов, программирования и потоков рассуждений в больших объёмах
вышла 11 марта
Характеристики
- Вышла
- 11 марта
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 262 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 262 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,20 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0,80 за миллион токенов
- Понимает
- текст
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- апрель 2024
- Идентификатор в API
- nvidia/nemotron-3-super-120b-a12b
Что это за модель
Nemotron 3 Super — вторая модель линейки Nemotron 3 от NVIDIA. По размеру она стоит между малой Nano и крупной Ultra. Всего в ней 120 млрд параметров, но на каждый токен работают только 12 млрд. Так устроена смесь экспертов (mixture of experts): модель состоит из многих подсетей-«экспертов» и для каждого токена включает лишь часть из них. Архитектура гибридная. Слои Mamba-2 экономно обрабатывают длинный текст, а отдельные слои внимания, как у обычных трансформеров, помогают точно находить нужное место в контексте.
NVIDIA добавила в модель несколько новых решений. Первое — LatentMoE: перед отправкой к экспертам токен сжимается, поэтому за те же вычисления модель может задействовать вчетверо больше экспертов. Второе — предсказание сразу нескольких следующих токенов: по данным компании, на структурированных ответах это ускоряет генерацию до трёх раз. Третье — модель с самого начала обучали в 4-битном формате NVFP4, а не сжимали после обучения. Компания заявляет, что пропускная способность выросла в пять раз по сравнению с прошлой Nemotron Super. При длинных ответах модель, по замерам NVIDIA, выдаёт в 2,2 раза больше токенов в секунду, чем GPT-OSS-120B, и в 7,5 раза больше, чем Qwen3.5-122B.
NVIDIA делала модель для систем из нескольких агентов. По словам компании, такие системы порождают в 15 раз больше токенов, чем обычный чат, и запускать на каждой подзадаче самую крупную модель слишком дорого и долго. Типичные задачи для Super — разбор заявок в IT-поддержке, генерация с поиском по документам, программирование и сложные рассуждения. В анонсе NVIDIA приводит такие результаты: 85,6% на PinchBench (тест на работу модели в роли «мозга» автономного агента), 60,47% на SWE-Bench в среде OpenHands, 90,21 на AIME25 и 83,73 на MMLU-Pro. Рассуждения перед ответом можно выключить, перевести в облегчённый режим или ограничить заданным числом токенов.
Сама модель, по заявлению лаборатории, работает с контекстом до миллиона токенов: на тесте RULER при такой длине её точность 91,75%. У провайдеров API лимит может быть ниже. Дообучение делали на семи языках: английском, французском, немецком, итальянском, японском, испанском и китайском. Русского среди них нет. Веса, обучающие наборы данных и рецепты обучения выложены открыто под лицензией NVIDIA Nemotron Open Model License, она разрешает коммерческое применение.
Источники: Анонс в техническом блоге NVIDIA, Карточка модели на Hugging Face
Другие модели семейства
-
Nemotron 3.5 Lightning 30B A3B
NVIDIAконтекст 262 тыс.бесплатнооткрытые весарассуждения
-
Nemotron 3 Ultra 550B A55B
NVIDIAконтекст 1 млн$0,50 / $2,50открытые весарассуждения
-
Nemotron 3 Nano Omni
NVIDIAконтекст 256 тыс.бесплатнооткрытые весарассуждения
-
nemotron-3-nano-30b-a3b
NVIDIAконтекст 131 тыс.бесплатнооткрытые весарассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).