NVIDIA выпустила Nemotron 3.5 Lightning — малую открытую модель для рутинной работы агентов
Nemotron 3.5 Lightning — открытая модель на 30 млрд параметров, из которых на каждый токен работают 3 млрд. Она берёт на себя рутинные шаги ИИ-агентов, а планирование оставляет крупным моделям.

NVIDIA выпустила Nemotron 3.5 Lightning — самую маленькую модель семейства Nemotron 3. Компания делала её не для сложных рассуждений, а для рутины, на которую уходит основное время ИИ-агентов. Это вызовы инструментов, проверка результатов и передача задач субагентам. Гонять через дорогую передовую модель каждый такой шаг долго и накладно.
Модель устроена как смесь экспертов. Всего в ней 30 млрд параметров, но на каждый токен работают только 3 млрд. Так она получает запас знаний крупной модели, а стоит в работе как маленькая. Для ускорения в ней есть спекулятивное декодирование: модель набрасывает сразу несколько токенов, а потом быстро их проверяет. Этому её учили ещё при предобучении. Вместе с ней NVIDIA выпустила две вспомогательные черновые модели, DSpark и DFlash. DSpark компания рекомендует для настольного компьютера DGX Spark и серверов с небольшой нагрузкой.
Результаты NVIDIA приводит такие. В рейтинге Artificial Analysis Intelligence Index модель, по её словам, лучше всех малых открытых моделей сочетает точность и скорость. Вывод у неё до четырёх раз быстрее, чем у моделей того же размера. На бенчмарке PinchBench она показала точность 86% и выполнила 10 000 задач на 30% быстрее, чем Qwen3.6 35B, при сопоставимой точности.
Кроме обычной версии, есть сжатая в формате NVFP4. Она работает на видеокартах поколений Blackwell, Hopper и Ampere — от дата-центра до GeForce RTX 5090, Jetson и DGX Spark. Модель поддерживают LM Studio, llama.cpp, Ollama и Unsloth. Веса, обучающие данные и рецепты открыты по лицензии OpenMDW-1.1, так что модель можно дообучить под свою задачу.
Вместе с моделью NVIDIA представила библиотеку NeMo Switchyard. Она распределяет запросы между моделями: планирование отправляет передовым моделям вроде Nemotron 3 Ultra, а исполнение — Lightning. Все цифры производительности пока от самой NVIDIA, независимых сравнений в материале нет.