ИИтак

← Назад

NVIDIA ужала Nemotron 3.5 Lightning втрое и объяснила, как сохранила точность

NVIDIA выпустила 4-битную версию Nemotron 3.5 Lightning: вместо 66 ГБ она весит 22 ГБ и работает до четырёх раз быстрее. Точность компания удержала за счёт дистилляции от полной модели. Рецепт открыт.

NVIDIA выпустила сжатую версию открытой модели Nemotron 3.5 Lightning в формате NVFP4. Большая часть весов хранится в 4 битах, поэтому модель весит 22 ГБ вместо 66 ГБ. По данным компании, её пропускная способность выросла до четырёх раз. Готовый файл модели выложен на Hugging Face, а весь процесс сжатия встроен в открытый инструмент NVIDIA Model Optimizer.

Саму Lightning NVIDIA представила неделей раньше. Это модель на 30 млрд параметров, из которых на каждом шаге работают 3 млрд. Её задача — рутинная часть работы ИИ-агентов. Теперь инженеры рассказали, как сжимали модель так, чтобы она не поглупела.

Обычно модель квантизуют уже после обучения: веса просто огрубляют до низкой точности, а модель мирится с возникшей ошибкой. NVIDIA пошла дальше и добавила квантизационную дистилляцию. Сначала модель сжимают грубее, чем обычно рискнули бы. Потом сжатую версию дообучают повторять ответы исходной модели, которую в это время не трогают. При этом сжатая модель с самого начала работает с огрублёнными весами и учится подстраиваться под эту ошибку.

На промежуточных версиях модели метод заметно помог. В одном опыте квантизация без дообучения сохраняла 96,33% исходной точности по медиане бенчмарков, а после 200 итераций дистилляции стало 99,72%. В другом опыте результат вырос с 95,84% до 98,53%. Размер во всех случаях был одинаковым — 21,19 ГБ.

Для выпущенной версии NVIDIA выбрала более осторожную схему сжатия. Простая квантизация сохранила 99,24% точности, дистилляция — 98,97%, то есть по медиане она даже немного уступила. Зато она выиграла на агентных задачах и программировании: 3,79 пункта на Terminal-Bench v2.1 и 1,07 пункта на SWE-Bench Multilingual.

Для длинных контекстов пришлось обучать на последовательностях примерно в 522 тысячи токенов, иначе модель теряла в качестве. Повторить опыт NVIDIA советует на своих открытых наборах данных Nemotron-Post-Training v1 и v2. Тот же сценарий запуска подходит и для Nemotron 3 Nano.

← Все новости