ИИтак

← Назад

Модель · NVIDIA

Nemotron 3.5 Lightning 30B A3B

Лёгкая открытая модель NVIDIA для агентов: быстро выполняет рутинные шаги вроде вызова инструментов и проверки результатов

вышла 11 августа

Характеристики

Вышла
11 августа
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
262 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 262 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
nvidia/nemotron-3.5-lightning-30b-a3b

Что это за модель

Nemotron 3.5 Lightning — открытая модель NVIDIA на 30 млрд параметров, построенная как смесь экспертов (mixture of experts): на каждый токен работает только около 3 млрд параметров. Поэтому знаний у неё как у модели на 30 млрд параметров, а вычислений она требует как малая. Устроена она гибридно: слои Mamba-2 чередуются со слоями экспертов, а слоёв внимания, как в обычных трансформерах, лишь несколько. По данным карточки модели, её предобучили на более чем 20 трлн токенов, затем дообучили на примерах и обучением с подкреплением на задачах по математике, программированию и работе с инструментами.

Это первая модель линейки Nemotron 3.5 и самая маленькая в семействе рядом с Nemotron 3 Super и Nemotron 3 Ultra. Её главное отличие — упор на скорость. Уже при обучении модель научили предсказывать сразу несколько токенов, а к ней выпустили отдельные черновые модели DFlash и DSpark для спекулятивного декодирования: малая модель быстро набрасывает текст, а основная его проверяет. По замерам NVIDIA, модель выдаёт текст до 4 раз быстрее моделей схожего размера, а на бенчмарке PinchBench набирает 86% и проходит 10 000 задач на 30% быстрее Qwen3.6 35B при сходной точности.

NVIDIA позиционирует её как исполнителя внутри долгих агентных систем. Планирует и рассуждает крупная модель, а Lightning берёт на себя массовую рутину: вызывает инструменты, проверяет результаты, раздаёт поручения вспомогательным агентам. Режим рассуждений перед ответом можно включать и выключать. В карточке модели приведены баллы 81,94 на MMLU Pro, 75,44 на GPQA Diamond и 51,56 на SWE-bench Verified. Модель удобно дообучать под свою задачу: NVIDIA открыла не только веса, но и данные для обучения и рецепты.

Лучше всего модель знает английский и языки программирования, кроме них заявлены испанский, французский, немецкий, итальянский и японский. Русского в этом списке нет. Полную версию весов NVIDIA советует брать для дообучения, а для работы — сжатый вариант в формате NVFP4. На одной видеокарте H100 контекст упирается в память примерно на 256 тыс. токенов, для большего нужны несколько видеокарт или новое железо. Лицензия OpenMDW-1.1 разрешает коммерческое использование.

Источники: Анонс в техническом блоге NVIDIA, Карточка модели на Hugging Face

Другие модели семейства

Новости о модели

  1. 01

    Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

    Яндекс

  2. 02

    Яндекс выложил открытую базовую модель AliceAI-Foundation на 80 млрд параметров

    Яндекс · HF

  3. 03

    NVIDIA на примере Nemotron 3.5 Lightning объяснила, когда смесь экспертов лучше плотной модели

    NVIDIA для разработчиков

  4. 04

    NVIDIA научила малую модель Nemotron распределять дефицитные детали как опытные плановики

    NVIDIA для разработчиков

  5. 05

    Модель на 350 млн параметров научили лучше выдавать JSON за 100 шагов на бесплатной GPU

    Hugging Face

  6. 06

    Cohere советует компаниям не звать большую модель туда, где справится малая

    Cohere

все 8 новостей о Nemotron 3.5 →

Данные: models.dev (MIT).