Модель · NVIDIA
Nemotron 3 Nano Omni
Лёгкая открытая модель NVIDIA для агентов, которые разбирают документы, видео, аудио и экраны компьютера
вышла 28 апреля
Характеристики
- Вышла
- 28 апреля
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 256 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 65 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0 за миллион токенов
- Понимает
- текст, изображения, видео, аудио
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- nvidia/nemotron-3-nano-omni-30b-a3b-reasoning
Что это за модель
Nemotron 3 Nano Omni — открытая модель NVIDIA, которая в одной сети понимает текст, картинки, видео и звук, а отвечает текстом. В ней около 31 млрд параметров, но на каждый токен работают лишь около 3 млрд. Так устроена смесь экспертов (mixture of experts): под каждый фрагмент включаются только нужные части сети. Основа гибридная: слои Mamba экономят вычисления на длинных входах, слои трансформера отвечают за рассуждения. Картинки и кадры обрабатывает отдельный визуальный кодировщик RADIO, звук — кодировщик речи Parakeet.
От текстовой Nemotron 3 Nano её отличает понимание звука и видео. Для видео NVIDIA добавила учёт движения между кадрами и сжатие визуальных токенов, чтобы длинные ролики не забивали контекст. Компания предлагает Omni вместо связки из отдельных моделей для зрения, речи и текста: по её словам, так меньше обращений к разным моделям и проще собирать систему. По замерам NVIDIA, модель лучшая в своём классе на тестах распознавания документов MMlongbench-Doc и OCRBenchV2 и лидирует на тестах понимания видео и звука WorldSense, DailyOmni и VoiceBench. В карточке модели приведены, например, 72,2% на Video MME и 47,4% на OSWorld — тесте управления компьютером.
Модель берут для разбора больших документов и сканов, расшифровки и анализа записей, поиска событий в видео, автоматизации работы с интерфейсом программ, а также для агентов в финансах, медицине и медиа. Рассуждения перед ответом включены по умолчанию, их можно отключить ради скорости. Веса выложены в нескольких вариантах точности. Сжатая версия NVFP4 помещается на одну игровую видеокарту RTX 5090, полная версия требует одной H100.
У модели есть ограничения. Она понимает только английский язык. Аудио принимает длиной до часа, видео — до двух минут. Веса распространяются по лицензии NVIDIA Open Model License: она разрешает коммерческое использование, но это не стандартная открытая лицензия вроде Apache 2.0.
Источники: Анонс в техническом блоге NVIDIA, Карточка модели на Hugging Face
Другие модели семейства
-
Nemotron 3.5 Lightning 30B A3B
NVIDIAконтекст 262 тыс.бесплатнооткрытые весарассуждения
-
Nemotron 3 Ultra 550B A55B
NVIDIAконтекст 1 млн$0,50 / $2,50открытые весарассуждения
-
Nemotron 3 Super
NVIDIAконтекст 262 тыс.$0,20 / $0,80открытые весарассуждения
-
nemotron-3-nano-30b-a3b
NVIDIAконтекст 131 тыс.бесплатнооткрытые весарассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).