ИИтак

← Назад

Модель · NVIDIA

Nemotron 3 Nano Omni

Лёгкая открытая модель NVIDIA для агентов, которые разбирают документы, видео, аудио и экраны компьютера

вышла 28 апреля

Характеристики

Вышла
28 апреля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
256 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 65 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0 за миллион токенов
Понимает
текст, изображения, видео, аудио
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
nvidia/nemotron-3-nano-omni-30b-a3b-reasoning

Что это за модель

Nemotron 3 Nano Omni — открытая модель NVIDIA, которая в одной сети понимает текст, картинки, видео и звук, а отвечает текстом. В ней около 31 млрд параметров, но на каждый токен работают лишь около 3 млрд. Так устроена смесь экспертов (mixture of experts): под каждый фрагмент включаются только нужные части сети. Основа гибридная: слои Mamba экономят вычисления на длинных входах, слои трансформера отвечают за рассуждения. Картинки и кадры обрабатывает отдельный визуальный кодировщик RADIO, звук — кодировщик речи Parakeet.

От текстовой Nemotron 3 Nano её отличает понимание звука и видео. Для видео NVIDIA добавила учёт движения между кадрами и сжатие визуальных токенов, чтобы длинные ролики не забивали контекст. Компания предлагает Omni вместо связки из отдельных моделей для зрения, речи и текста: по её словам, так меньше обращений к разным моделям и проще собирать систему. По замерам NVIDIA, модель лучшая в своём классе на тестах распознавания документов MMlongbench-Doc и OCRBenchV2 и лидирует на тестах понимания видео и звука WorldSense, DailyOmni и VoiceBench. В карточке модели приведены, например, 72,2% на Video MME и 47,4% на OSWorld — тесте управления компьютером.

Модель берут для разбора больших документов и сканов, расшифровки и анализа записей, поиска событий в видео, автоматизации работы с интерфейсом программ, а также для агентов в финансах, медицине и медиа. Рассуждения перед ответом включены по умолчанию, их можно отключить ради скорости. Веса выложены в нескольких вариантах точности. Сжатая версия NVFP4 помещается на одну игровую видеокарту RTX 5090, полная версия требует одной H100.

У модели есть ограничения. Она понимает только английский язык. Аудио принимает длиной до часа, видео — до двух минут. Веса распространяются по лицензии NVIDIA Open Model License: она разрешает коммерческое использование, но это не стандартная открытая лицензия вроде Apache 2.0.

Источники: Анонс в техническом блоге NVIDIA, Карточка модели на Hugging Face

Другие модели семейства

Новости о модели

  1. 01

    Натан Ламберт рассказал Конгрессу, насколько Китай обогнал США в открытых моделях

    Interconnects

  2. 02

    Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

    Яндекс

  3. 03

    Яндекс выложил открытую базовую модель AliceAI-Foundation на 80 млрд параметров

    Яндекс · HF

  4. 04

    NVIDIA на примере Nemotron 3.5 Lightning объяснила, когда смесь экспертов лучше плотной модели

    NVIDIA для разработчиков

  5. 05

    NVIDIA ускорила Nemotron 3 Ultra в NIM: на четырёх B200 помещается в 2,5 раза больше пользователей

    NVIDIA для разработчиков

  6. 06

    NVIDIA научила малую модель Nemotron распределять дефицитные детали как опытные плановики

    NVIDIA для разработчиков

все 17 новостей о Nemotron 3 →

Данные: models.dev (MIT).