ИИтак

← Назад

Модель · Z.ai

GLM-5

Бывший флагман Z.ai с открытыми весами для программирования и агентных задач, его уже сменили GLM-5.1 и более новые версии

вышла 12 февраля

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

70 место из 266
индекс 146, вероятный разброс 144–148 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
CL-benchУмение выучить новое прямо из длинного текста: вымышленные законы, языки программирования, правила — и решить по ним задачиЗадача засчитывается, только если ответ проходит все проверочные критерии экспертов, поэтому даже лидеры решают около четверти.Подробнее на английском ↗ 18,7%
APEX-Agents480 многошаговых рабочих задач из инвестбанкинга, консалтинга и корпоративного права: агент работает с файлами, почтой, таблицамиЗадача засчитывается, только если выполнены все пункты экспертного списка критериев; проверяет их другая модель.Подробнее на английском ↗ 17,2%
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 5,3%
FrontierMath-Tier-4-2025-07-01-PrivateСамый сложный уровень FrontierMath: исследовательские задачи по математике, на которые у математика уходят часы или дниРезультат посчитан на закрытом наборе задач версии от июля 2025 года; в 2026 году вышла исправленная версия, и числа двух версий не сравнимы.Подробнее на английском ↗ 3,5%
Terminal BenchЗадачи в командной строке по мотивам реальной работы: агент сам выполняет их в терминале, результат проверяют автотестыПодробнее на английском ↗ 52,4%
ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ 4,9%
FrontierMath-2025-02-28-PrivateНеопубликованные задачи FrontierMath (уровни 1–3) в версии от 28.02.2025: трудная математика, над которой специалист сидит часамиПодробнее на английском ↗ 28,8%
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 48,2%
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 80,0%
SimpleBenchВопросы с подвохом на здравый смысл: пространство, время, поведение людей. 213 вопросов, у каждого шесть вариантов ответаЛюди в проверке авторов набрали около 84%, а балл модели — средняя точность по пяти прогонам.Подробнее на английском ↗ 43,8%
SWE-Bench verifiedНастоящие задачи из GitHub по проектам на Python: модель правит код, а тесты проверяют, решена ли проблемаПо оценке Epoch, в 5–10% задач есть ошибки, поэтому 100% недостижимы; Epoch считает результат по 484 задачам из 500.Подробнее на английском ↗ 72,1%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 83,8%
ARC-AGIГоловоломки на цветных клетках: по паре примеров нужно понять правило преобразования картинки и применить его к новойПодробнее на английском ↗ 44,7%

Характеристики

Вышла
12 февраля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
204 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 131 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$1 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,20 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$3,20 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
glm-5

Что это за модель

GLM-5 — большая языковая модель китайской лаборатории Z.ai, на момент выхода её флагман. Она построена как смесь экспертов: это схема, при которой на каждый токен работает только часть сети. Всего у неё 744 млрд параметров, активны 40 млрд. Чтобы длинные тексты обходились дешевле, в неё встроен механизм разреженного внимания DeepSeek Sparse Attention: модель смотрит не на весь контекст сразу, а на отобранные его части.

По сравнению с прошлыми версиями линейки модель заметно выросла: у GLM-4.5 было 355 млрд параметров, а данных для предобучения стало 28,5 трлн токенов вместо 23 трлн. Для дообучения с подкреплением лаборатория сделала собственную асинхронную систему, которая, по её словам, ускорила обучение и позволила чаще проводить итерации. По замерам Z.ai, результат на SWE-bench Verified вырос с 73,8 у GLM-4.7 до 77,8, а на тесте по кибербезопасности CyberGym — с 23,5 до 43,2. Компания заявляет, что в программировании модель приближается к Claude Opus 4.5, а среди моделей с открытыми весами первая на BrowseComp, MCP-Atlas и τ²-Bench.

Z.ai позиционирует GLM-5 для «агентной разработки»: сложных инженерных систем и долгих задач, где модель сама вызывает инструменты и выполняет работу в несколько этапов. В документации также названы перевод, извлечение данных из сложных документов, ролевые диалоги и написание сценариев. Модель работает только с текстом: картинки понимает отдельная GLM-5V-Turbo.

Веса опубликованы под свободной лицензией MIT, поэтому модель можно запускать на своём оборудовании и дообучать. При этом 744 млрд параметров требуют серьёзного серверного железа. Сейчас GLM-5 уже не самая новая модель линейки: за ней вышли GLM-5.1, GLM-5.2 и GLM-5.3.

Источники: Карточка модели на Hugging Face, Документация Z.ai по GLM-5

Того же уровня по индексу Epoch

Другие модели семейства

Новости о модели

  1. 01

    Натан Ламберт рассказал Конгрессу, насколько Китай обогнал США в открытых моделях

    Interconnects

  2. 02

    «Интеллект растёт экспоненциально»: Маск о малых открытых моделях, обошедших лидеров 2025 года

    Илон Маск

  3. 03

    Z.ai собрала инфраструктуру для GLM-5.3-Flash с помощью GLM-5.3

    Z.ai · X

  4. 04

    DeepSeek V4.1-Flash в независимых тестах: очень многословна, но всё равно дешевле всех

    Latent Space

  5. 05

    Z.ai закрутила лицензию GLM-5.3: гигантам с выручкой от 10 млрд долларов нужна её проверка

    Interconnects

  6. 06

    IBM и Red Hat запустили GLM-5.2 на 544 картах H100 для 3 000 агентов разом

    IBM Research

все 15 новостей о GLM-5 →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).