ИИтак

← Назад

Модель · NVIDIA

nemotron-3-nano-30b-a3b

Лёгкая открытая модель NVIDIA для агентов, программирования и математики: 30 млрд параметров, из них работают около 3 млрд

вышла 1 декабря 2024

Характеристики

Вышла
1 декабря 2024
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
131 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 131 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
сентябрь 2024
Идентификатор в API
nvidia/nemotron-3-nano-30b-a3b

Что это за модель

Nemotron 3 Nano — младшая модель линейки Nemotron 3. NVIDIA представила её в декабре 2025 года вместе с анонсом более крупных Super и Ultra. Устроена она необычно: это гибрид слоёв Mamba-2 и трансформера. Mamba-2 — архитектура, которая дёшево обрабатывает длинные тексты, а слоёв внимания, как у классических трансформеров, в модели немного. Вместо обычных блоков в ней стоит смесь экспертов (mixture of experts): из 128 подсетей на каждый токен включаются только шесть. Поэтому из примерно 31,6 млрд параметров в работе одновременно около 3,5 млрд.

Главное отличие от предыдущей Nemotron Nano 2 — именно смесь экспертов. По словам NVIDIA, из-за неё новая модель отвечает до четырёх раз быстрее при том же качестве рассуждений. С открытыми моделями того же класса компания сравнивает её так: на задачах с входом в 8 тыс. и ответом в 16 тыс. токенов она выдаёт в 3,3 раза больше текста в секунду, чем Qwen3-30B-A3B, и в 2,2 раза больше, чем GPT-OSS-20B. По точности на популярных бенчмарках, по замерам лаборатории, она им не уступает или обходит. Позже у NVIDIA вышли и более новые модели того же размера, например Nemotron 3.5 Lightning 30B A3B.

Модель берут для систем, где много агентов работают параллельно и важны скорость и цена: многошаговые вызовы инструментов, программирование, математика, генерация с поиском по документам. Рассуждения можно включать и выключать. С ними модель строит цепочку рассуждений для сложных задач, без них отвечает коротко и быстро. Есть и лимит на рассуждения: он ограничивает число токенов на размышления, чтобы стоимость ответа была предсказуемой. Архитектура рассчитана на контекст до миллиона токенов, но в стандартной настройке на Hugging Face стоит 256 тыс., чтобы модель поместилась в память видеокарты.

Веса выложены под лицензией NVIDIA Nemotron Open Model License, она разрешает коммерческое использование. Вместе с моделью NVIDIA открыла большую часть данных для обучения и дообучения. Официально поддерживаются английский, испанский, французский, немецкий, итальянский и японский, а основным языком компания называет английский. Если выключить рассуждения, на трудных задачах точность падает. В данных для обучения есть перекосы, например мужчины упоминаются чаще женщин, поэтому NVIDIA советует проверять модель на предвзятость, прежде чем использовать её в своих задачах.

Источники: Анонс Nemotron 3 Nano в блоге NVIDIA на Hugging Face, Карточка модели на Hugging Face

Другие модели семейства

Новости о модели

  1. 01

    NVIDIA ускорила Nemotron 3 Ultra в NIM: на четырёх B200 помещается в 2,5 раза больше пользователей

    NVIDIA для разработчиков

  2. 02

    Nemotron 3 Ultra лучше других открытых моделей проектирует микросхемы и тратит меньше токенов

    NVIDIA для разработчиков

все 2 новости о nemotron-3-nano-30b-a3b →

Данные: models.dev (MIT).