ИИтак

← Назад

Модель · Z.ai

GLM-5.1

Бывший флагман Z.ai для агентного программирования и долгих задач, открытые веса; её сменили GLM-5.2 и GLM-5.3

вышла 7 апреля

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

48 место из 266
индекс 150, вероятный разброс 148–151 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
FrontierMath-Tiers-1-3-v2-PrivateСотни новых задач исследовательской математики от профессиональных математиков; эксперту на задачу нужны часы или дниПодробнее на английском ↗ 36,8%
ExploitBenchНаписание эксплойтов для 41 реальной уязвимости движка V8 — от вызова сбоя до выполнения произвольного кодаВзлом разбит на 16 ступеней, и засчитываются промежуточные, так что балл не равен доле полностью взломанных уязвимостей.Подробнее на английском ↗ 18,1%
ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ 22,2%
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 14,8%
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 34,0%
FrontierMath-Tier-4-2025-07-01-PrivateСамый сложный уровень FrontierMath: исследовательские задачи по математике, на которые у математика уходят часы или дниРезультат посчитан на закрытом наборе задач версии от июля 2025 года; в 2026 году вышла исправленная версия, и числа двух версий не сравнимы.Подробнее на английском ↗ 20,8%
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 57,1%
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 93,3%
SimpleBenchВопросы с подвохом на здравый смысл: пространство, время, поведение людей. 213 вопросов, у каждого шесть вариантов ответаЛюди в проверке авторов набрали около 84%, а балл модели — средняя точность по пяти прогонам.Подробнее на английском ↗ 46,1%
SWE-Bench verifiedНастоящие задачи из GitHub по проектам на Python: модель правит код, а тесты проверяют, решена ли проблемаПо оценке Epoch, в 5–10% задач есть ошибки, поэтому 100% недостижимы; Epoch считает результат по 484 задачам из 500.Подробнее на английском ↗ 74,2%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 86,5%

Характеристики

Вышла
7 апреля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
200 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 131 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$1,40 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,26 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$4,40 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
glm-5.1

Что это за модель

GLM-5.1 — модель китайской компании Z.ai с открытыми весами. На момент выхода компания называла её своим флагманом для агентной разработки, то есть для работы, в которой модель сама планирует шаги, запускает инструменты и проверяет результат. Устроена она как смесь экспертов (mixture of experts): всего у неё 754 млрд параметров, но на каждый шаг работает только часть из них.

От GLM-5 она отличается прежде всего тем, как долго может держать одну задачу. По словам Z.ai, GLM-5.1 способна до восьми часов без участия человека работать над одной задачей: планировать, писать код, проверять и улучшать его сотнями итераций, не теряя цели. В демонстрациях компании модель прошла 655 итераций при сборке рабочего стола под Linux, а на KernelBench Level 3 ускорила код в 3,6 раза. Лаборатория заявляет, что по общему уровню модель сопоставима с Claude Opus 4.6.

Главная сфера — программирование. По замерам Z.ai, модель набрала 58,4 балла на SWE-Bench Pro (исправление реальных ошибок в репозиториях) и на момент выхода обошла там GPT-5.4, Claude Opus 4.6 и Gemini 3.1 Pro. Ещё она набрала 63,5 на Terminal-Bench 2.0 (работа в командной строке) и 42,7 на NL2Repo (создание целого репозитория по описанию). Кроме кода, компания предлагает её для обычных диалогов, текстов, вёрстки интерфейсов и работы с офисными документами.

Модель понимает только текст, картинки она не принимает: для этого у Z.ai есть отдельная GLM-5V-Turbo. Веса выложены под лицензией MIT, она позволяет и коммерческое использование. Но при таком размере запустить модель у себя можно только на серверном оборудовании. Сейчас в линейке есть более новые GLM-5.2 и GLM-5.3.

Источники: Анонс GLM-5.1 в блоге Z.ai, Карточка модели на Hugging Face, Документация для разработчиков

Того же уровня по индексу Epoch

Другие модели семейства

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).