Модель · Meta
Muse Spark 1.2
Модель Meta для программирования и агентов, обученная вместе с Muse Code. Её уже сменила Muse Spark 1.3
вышла 5 августа
Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗
21 место из 266
индекс 155, вероятный разброс 154–159 · весь рейтинг →
| Бенчмарк | РезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию теста | УсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен |
|---|---|---|
| DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ | 91,1% | очень высокое |
| LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ | 56,9% | очень высокое |
| DeepSWE113 долгих задач по программированию в 91 открытом проекте на пяти языках; задачи написаны с нуля и не публиковалисьEpoch нашла, что примерно в 20% задач проверка отклоняет верные решения, поэтому реальный потолок заметно ниже 100%.Подробнее на английском ↗ | 54,9% | очень высокое |
| ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ | 43,0% | |
| SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ | 60,3% | очень высокое |
| WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ | 60,3% | очень высокое |
| SimpleBenchВопросы с подвохом на здравый смысл: пространство, время, поведение людей. 213 вопросов, у каждого шесть вариантов ответаЛюди в проверке авторов набрали около 84%, а балл модели — средняя точность по пяти прогонам.Подробнее на английском ↗ | 69,4% |
Характеристики
- Вышла
- 5 августа
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 1 млн токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 131 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $1,25 за миллион токенов
- Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
- $0,15 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $4,25 за миллион токенов
- Понимает
- текст, изображения, видео, PDF, аудио
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Идентификатор в API
- muse-spark-1.2
Что это за модель
Muse Spark 1.2 — модель Meta для программирования. Компания выпустила её вместе с Muse Code — агентом, который работает в терминале, как Claude Code или Codex CLI. Ему ставят задачу, а он сам пишет и правит код прямо в проекте. Модель обучали вместе с этим агентом: Muse Code с самого начала был в цикле обучения. Поэтому модель надёжнее вызывает инструменты и доводит до конца свой план работы. По словам Meta, в других агентах для программирования она тоже работает хорошо.
От Muse Spark 1.1 новая версия отличается упором на код. Сама Meta называет это умеренным улучшением. Модель лучше пишет код, ищет сложные ошибки, разбирается в крупных кодовых базах и ведёт процесс разработки целиком. Компания заметно увеличила объём обучения на задачах программирования и сделала учебные среды разнообразнее. Часть данных модели сделали сами: версия 1.1 придумывала сложные учебные задачи, а версия 1.2 оценивала их решения. В сентябре линейку обновили до Muse Spark 1.3.
Модель берут для долгих задач, которые идут часами: написать целый репозиторий, провести многошаговую переработку кода, распутать зависимости в старом коде. Для этого её учили планировать, держать цель и сжимать контекст. Сжатие контекста — это пересказ уже сделанного в короткой форме, чтобы ничего не забыть на длинной дистанции. Ещё она умеет вызывать инструменты параллельно и не дожидаясь результата. В демонстрации Meta модель 24 часа оптимизировала GPU-ядра — небольшие программы, которые выполняются на видеокарте, — и сделала больше тысячи вызовов инструментов. По данным компании, прирост к исходным версиям ядер продолжался всё это время.
Модель рассуждает перед ответом, и эти токены оплачиваются как вывод. Поэтому на сложных задачах запрос может стоить заметно дороже, чем кажется по длине ответа. Рядом есть вариант Muse Spark 1.2 Contributor. У него та же модель, но другой способ оплаты: вместо платы за каждый токен действует лимит на объём работы за скользящие пять часов. Этот вариант доступен только в некоторых странах.
Источники: Анонс Muse Spark 1.2 и Muse Code для разработчиков, Muse Code и Muse Spark 1.2 в блоге Meta AI Research
Того же уровня по индексу Epoch
-
GPT-5.2 Pro
OpenAI23-е место в Epochконтекст 400 тыс.$21 / $168рассуждениядороже в 40 раз
-
Claude Opus 4.6
Anthropic24-е место в Epochконтекст 1 млн$5 / $25рассуждениядороже в 5,9 раза
-
Gemini 3.1 Pro Preview
Google27-е место в Epochконтекст 1 млн$2 / $12рассуждениядороже в 2,8 раза
Другие модели семейства
-
Muse Spark 1.3
Metaконтекст 1 млн$1,25 / $4,25рассуждения
-
Muse Spark 1.3 Contributor
Metaконтекст 1 млн$0,10 / $0,20рассуждения
-
Muse Spark 1.2 Contributor
Metaконтекст 1 млн$0,10 / $0,20рассуждения
-
Muse Spark 1.1
Meta29-е место в Epochконтекст 1 млн$1,25 / $4,25рассуждения
Новости о модели
- 01
Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).