Модель · Z.ai
GLM-5
Бывший флагман Z.ai с открытыми весами для программирования и агентных задач, его уже сменили GLM-5.1 и более новые версии
вышла 12 февраля
Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗
70 место из 266
индекс 146, вероятный разброс 144–148 · весь рейтинг →
| Бенчмарк | РезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию теста | УсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен |
|---|---|---|
| CL-benchУмение выучить новое прямо из длинного текста: вымышленные законы, языки программирования, правила — и решить по ним задачиЗадача засчитывается, только если ответ проходит все проверочные критерии экспертов, поэтому даже лидеры решают около четверти.Подробнее на английском ↗ | 18,7% | |
| APEX-Agents480 многошаговых рабочих задач из инвестбанкинга, консалтинга и корпоративного права: агент работает с файлами, почтой, таблицамиЗадача засчитывается, только если выполнены все пункты экспертного списка критериев; проверяет их другая модель.Подробнее на английском ↗ | 17,2% | |
| Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ | 5,3% | |
| FrontierMath-Tier-4-2025-07-01-PrivateСамый сложный уровень FrontierMath: исследовательские задачи по математике, на которые у математика уходят часы или дниРезультат посчитан на закрытом наборе задач версии от июля 2025 года; в 2026 году вышла исправленная версия, и числа двух версий не сравнимы.Подробнее на английском ↗ | 3,5% | |
| Terminal BenchЗадачи в командной строке по мотивам реальной работы: агент сам выполняет их в терминале, результат проверяют автотестыПодробнее на английском ↗ | 52,4% | |
| ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ | 4,9% | |
| FrontierMath-2025-02-28-PrivateНеопубликованные задачи FrontierMath (уровни 1–3) в версии от 28.02.2025: трудная математика, над которой специалист сидит часамиПодробнее на английском ↗ | 28,8% | |
| WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ | 48,2% | |
| OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ | 80,0% | |
| SimpleBenchВопросы с подвохом на здравый смысл: пространство, время, поведение людей. 213 вопросов, у каждого шесть вариантов ответаЛюди в проверке авторов набрали около 84%, а балл модели — средняя точность по пяти прогонам.Подробнее на английском ↗ | 43,8% | |
| SWE-Bench verifiedНастоящие задачи из GitHub по проектам на Python: модель правит код, а тесты проверяют, решена ли проблемаПо оценке Epoch, в 5–10% задач есть ошибки, поэтому 100% недостижимы; Epoch считает результат по 484 задачам из 500.Подробнее на английском ↗ | 72,1% | |
| GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ | 83,8% | |
| ARC-AGIГоловоломки на цветных клетках: по паре примеров нужно понять правило преобразования картинки и применить его к новойПодробнее на английском ↗ | 44,7% |
Характеристики
- Вышла
- 12 февраля
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 204 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 131 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $1 за миллион токенов
- Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
- $0,20 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $3,20 за миллион токенов
- Понимает
- текст
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- glm-5
Что это за модель
GLM-5 — большая языковая модель китайской лаборатории Z.ai, на момент выхода её флагман. Она построена как смесь экспертов: это схема, при которой на каждый токен работает только часть сети. Всего у неё 744 млрд параметров, активны 40 млрд. Чтобы длинные тексты обходились дешевле, в неё встроен механизм разреженного внимания DeepSeek Sparse Attention: модель смотрит не на весь контекст сразу, а на отобранные его части.
По сравнению с прошлыми версиями линейки модель заметно выросла: у GLM-4.5 было 355 млрд параметров, а данных для предобучения стало 28,5 трлн токенов вместо 23 трлн. Для дообучения с подкреплением лаборатория сделала собственную асинхронную систему, которая, по её словам, ускорила обучение и позволила чаще проводить итерации. По замерам Z.ai, результат на SWE-bench Verified вырос с 73,8 у GLM-4.7 до 77,8, а на тесте по кибербезопасности CyberGym — с 23,5 до 43,2. Компания заявляет, что в программировании модель приближается к Claude Opus 4.5, а среди моделей с открытыми весами первая на BrowseComp, MCP-Atlas и τ²-Bench.
Z.ai позиционирует GLM-5 для «агентной разработки»: сложных инженерных систем и долгих задач, где модель сама вызывает инструменты и выполняет работу в несколько этапов. В документации также названы перевод, извлечение данных из сложных документов, ролевые диалоги и написание сценариев. Модель работает только с текстом: картинки понимает отдельная GLM-5V-Turbo.
Веса опубликованы под свободной лицензией MIT, поэтому модель можно запускать на своём оборудовании и дообучать. При этом 744 млрд параметров требуют серьёзного серверного железа. Сейчас GLM-5 уже не самая новая модель линейки: за ней вышли GLM-5.1, GLM-5.2 и GLM-5.3.
Источники: Карточка модели на Hugging Face, Документация Z.ai по GLM-5
Того же уровня по индексу Epoch
-
GPT-5.4 nano
OpenAI71-е место в Epochконтекст 400 тыс.$0,20 / $1,25рассуждениядешевле в 2,6 раза
-
MiniMax-M2.7
MiniMax72-е место в Epochконтекст 204 тыс.$0,30 / $1,20открытые весарассуждениядешевле в 2,7 раза
-
DeepSeek V4 Flash
DeepSeek69-е место в Epochконтекст 1 млн$0,15 / $0,60открытые весарассуждениядешевле в 5,3 раза
-
GPT-5 Mini
OpenAI75-е место в Epochконтекст 400 тыс.$0,25 / $2рассуждениядешевле в 1,6 раза
Другие модели семейства
-
GLM-5V-Turbo
Z.aiконтекст 200 тыс.$1,20 / $4рассуждения
-
GLM-5-Turbo
Z.aiконтекст 200 тыс.$1,20 / $4рассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).