ИИтак

← Назад

Модель · Mistral

Mistral Nemo

Бюджетная открытая модель Mistral и NVIDIA на 12 млрд параметров для многоязычных чатов и запуска на своём сервере

вышла 1 июля 2024

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

194 место из 266
индекс 119, вероятный разброс 112–122 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 14,3%
BalrogМодель играет в шесть текстовых и клеточных игр, от простых головоломок до NetHack, где нужно выжить и продвинутьсяБалл — средний прогресс от 0 до 100 по всем играм; в NetHack даже лидеры продвигаются очень мало.Подробнее на английском ↗ 17,6%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 6,5%
GSM8KТекстовые задачи по математике школьного уровня в несколько действий; засчитывается только точный числовой ответТест почти насыщен: современные модели решают почти все задачи, и лидеры различаются слабо.Подробнее на английском ↗ 84,2%
MATH level 5Самые трудные задачи (5-й уровень) из набора MATH — задачи американских школьных олимпиад AMC 10, AMC 12 и AIMEТест близок к насыщению: у сильных моделей результаты почти одинаковые и высокие, разница в несколько пунктов мало что значит.Подробнее на английском ↗ 10,8%
PIQAБытовая физическая смекалка: из двух способов выполнить житейское действие выбрать тот, что сработаетЛюди отвечают верно примерно в 95% случаев; тест почти насыщен, и сильные модели различаются слабо.Подробнее на английском ↗ 67,0%

Характеристики

Вышла
1 июля 2024
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
128 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 128 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,15 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,15 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
июль 2024
Идентификатор в API
mistral-nemo

Что это за модель

Mistral NeMo — языковая модель на 12 миллиардов параметров, которую Mistral сделала вместе с NVIDIA. Устроена она по обычной схеме трансформера. Веса выложены в двух вариантах: базовом и дообученном для выполнения инструкций, то есть для диалога.

Главная новинка — токенизатор Tekken, программа, которая режет текст на токены. Его обучили на текстах более чем на 100 языках. По замерам лаборатории, он сжимает код и тексты на основных языках примерно на 30% лучше прежнего токенизатора, а корейский и арабский — в два-три раза. Чем плотнее сжатие, тем больше текста помещается в тот же объём и тем дешевле обработка. Модель обучали с учётом квантизации — сжатия весов до меньшей точности. Поэтому, как заявляет Mistral, её можно запускать в формате FP8 без потери качества.

Mistral позиционирует NeMo как прямую замену Mistral 7B: её можно поставить в любую систему, где работала 7B, ничего не меняя. Компания сравнивала её с Gemma 2 9B и Llama 3 8B на тестах рассуждений, знаний и программирования и заявляет, что NeMo лучшая в своём классе. Лучше всего модель работает с английским, французским, немецким, испанским, итальянским, португальским, китайским, японским, корейским, арабским и хинди. Её берут для многоязычных чатов и простых задач, особенно когда модель нужно запускать на своём оборудовании.

Модель вышла летом 2024 года, и новые модели Mistral из линеек Small и Medium её заметно обогнали: в рейтинге Epoch NeMo стоит ближе к концу списка. Веса распространяются по лицензии Apache 2.0, которая разрешает и коммерческое применение, и дообучение.

Источники: Анонс Mistral NeMo

Того же уровня по индексу Epoch

Новости о модели

  1. 01

    NVIDIA на примере Nemotron 3.5 Lightning объяснила, когда смесь экспертов лучше плотной модели

    NVIDIA для разработчиков

все 1 новость о Mistral Nemo →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).