Модель · NVIDIA
Nemotron 3.5 Lightning 30B A3B
Лёгкая открытая модель NVIDIA для агентов: быстро выполняет рутинные шаги вроде вызова инструментов и проверки результатов
вышла 11 августа
Характеристики
- Вышла
- 11 августа
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 262 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 262 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0 за миллион токенов
- Понимает
- текст
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- nvidia/nemotron-3.5-lightning-30b-a3b
Что это за модель
Nemotron 3.5 Lightning — открытая модель NVIDIA на 30 млрд параметров, построенная как смесь экспертов (mixture of experts): на каждый токен работает только около 3 млрд параметров. Поэтому знаний у неё как у модели на 30 млрд параметров, а вычислений она требует как малая. Устроена она гибридно: слои Mamba-2 чередуются со слоями экспертов, а слоёв внимания, как в обычных трансформерах, лишь несколько. По данным карточки модели, её предобучили на более чем 20 трлн токенов, затем дообучили на примерах и обучением с подкреплением на задачах по математике, программированию и работе с инструментами.
Это первая модель линейки Nemotron 3.5 и самая маленькая в семействе рядом с Nemotron 3 Super и Nemotron 3 Ultra. Её главное отличие — упор на скорость. Уже при обучении модель научили предсказывать сразу несколько токенов, а к ней выпустили отдельные черновые модели DFlash и DSpark для спекулятивного декодирования: малая модель быстро набрасывает текст, а основная его проверяет. По замерам NVIDIA, модель выдаёт текст до 4 раз быстрее моделей схожего размера, а на бенчмарке PinchBench набирает 86% и проходит 10 000 задач на 30% быстрее Qwen3.6 35B при сходной точности.
NVIDIA позиционирует её как исполнителя внутри долгих агентных систем. Планирует и рассуждает крупная модель, а Lightning берёт на себя массовую рутину: вызывает инструменты, проверяет результаты, раздаёт поручения вспомогательным агентам. Режим рассуждений перед ответом можно включать и выключать. В карточке модели приведены баллы 81,94 на MMLU Pro, 75,44 на GPQA Diamond и 51,56 на SWE-bench Verified. Модель удобно дообучать под свою задачу: NVIDIA открыла не только веса, но и данные для обучения и рецепты.
Лучше всего модель знает английский и языки программирования, кроме них заявлены испанский, французский, немецкий, итальянский и японский. Русского в этом списке нет. Полную версию весов NVIDIA советует брать для дообучения, а для работы — сжатый вариант в формате NVFP4. На одной видеокарте H100 контекст упирается в память примерно на 256 тыс. токенов, для большего нужны несколько видеокарт или новое железо. Лицензия OpenMDW-1.1 разрешает коммерческое использование.
Источники: Анонс в техническом блоге NVIDIA, Карточка модели на Hugging Face
Другие модели семейства
-
Nemotron 3 Ultra 550B A55B
NVIDIAконтекст 1 млн$0,50 / $2,50открытые весарассуждения
-
Nemotron 3 Nano Omni
NVIDIAконтекст 256 тыс.бесплатнооткрытые весарассуждения
-
Nemotron 3 Super
NVIDIAконтекст 262 тыс.$0,20 / $0,80открытые весарассуждения
-
nemotron-3-nano-30b-a3b
NVIDIAконтекст 131 тыс.бесплатнооткрытые весарассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).