Модель · Mistral
Mistral Large 2.1
Бывший флагман Mistral конца 2024 года для текста, программирования и агентов, его сменила Mistral Large 3
вышла 18 ноября 2024
Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗
161 место из 266
индекс 129, вероятный разброс 125–131 · весь рейтинг →
| Бенчмарк | РезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию теста | УсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен |
|---|---|---|
| DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ | 34,7% | |
| FrontierMath-2025-02-28-PrivateНеопубликованные задачи FrontierMath (уровни 1–3) в версии от 28.02.2025: трудная математика, над которой специалист сидит часамиПодробнее на английском ↗ | 0,6% | |
| OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ | 7,7% | |
| GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ | 35,1% | |
| MATH level 5Самые трудные задачи (5-й уровень) из набора MATH — задачи американских школьных олимпиад AMC 10, AMC 12 и AIMEТест близок к насыщению: у сильных моделей результаты почти одинаковые и высокие, разница в несколько пунктов мало что значит.Подробнее на английском ↗ | 50,3% |
Характеристики
- Вышла
- 18 ноября 2024
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 131 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 16 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $2 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $6 за миллион токенов
- Понимает
- текст
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- ноябрь 2024
- Идентификатор в API
- mistral-large-2411
Что это за модель
Mistral Large 2.1 — это обновление большой языковой модели Mistral, в документации она называется Mistral Large 24.11. Модель плотная: при каждом ответе работают все её 123 миллиарда параметров, а не часть, как в архитектуре «смесь экспертов». Mistral выпустила её в ноябре 2024 года вместе с мультимодальной Pixtral Large и тогда называла своей главной моделью для сложных рассуждений и программирования.
От предыдущей версии Mistral Large 24.07 она отличается в трёх местах. Лучше понимает длинные документы. Точнее следует системному запросу, то есть заранее заданным правилам поведения. Аккуратнее вызывает функции — внешние инструменты, которые разработчик ей подключает. Компания называет это заметным шагом вперёд по сравнению с июльской версией.
Mistral предлагала её для генерации с поиском (когда модель отвечает с опорой на найденные документы) и для агентных процессов, где модель сама выполняет шаги задачи. Среди корпоративных сценариев компания называет работу с базами знаний, разбор документов, автоматизацию задач и поддержку клиентов. По карточке модели, она владеет десятками языков, включая английский, французский, немецкий, испанский, китайский, японский и корейский, пишет код на 80 с лишним языках программирования и умеет отдавать ответ в формате JSON.
Сегодня это старая модель. В рейтинге Epoch она стоит около середины, при этом дороже трёх четвертей каталога, а более новые модели Mistral её обошли. Веса открыты, но по лицензии Mistral Research License их можно бесплатно использовать и менять только в некоммерческих целях. Для работы в продукте нужна отдельная коммерческая лицензия. Запустить её у себя тоже непросто: по карточке модели, нужно больше 300 ГБ видеопамяти.
Источники: Анонс Pixtral Large и Mistral Large 24.11, Карточка модели на Hugging Face
Того же уровня по индексу Epoch
-
Qwen2.5 32B Instruct
Qwen160-е место в Epochконтекст 131 тыс.$0,70 / $2,80открытые весадешевле в 2,1 раза
-
Qwen2.5 72B Instruct
Qwen155-е место в Epochконтекст 131 тыс.$1,40 / $5,60открытые весадешевле
-
GPT-4o mini
OpenAI170-е место в Epochконтекст 128 тыс.$0,15 / $0,60дешевле в 10 раз
Другие модели семейства
-
Mistral Large 3
Mistralконтекст 262 тыс.$0,50 / $1,50открытые веса
Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).