ИИтак

← Назад

Модель · Z.ai

GLM-5.3

Флагманская модель Z.ai с открытыми весами для долгих задач по программированию, работы агентов и кибербезопасности

вышла 14 августа

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

25 место из 266
индекс 155, вероятный разброс 153–158 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
Mystery Game Puzzles100 позиций из головоломочного варианта известной игры, название которой скрыто: нужно найти единственный лучший ходПодробнее на английском ↗ 26,2% максимальное
FrontierMath-Tier-4-v2-PrivateЗакрытый набор самых трудных задач FrontierMath: исследовательская математика, на которую у специалистов уходят часы и дниПодробнее на английском ↗ 29,3% максимальное
FrontierMath-Tiers-1-3-v2-PrivateСотни новых задач исследовательской математики от профессиональных математиков; эксперту на задачу нужны часы или дниПодробнее на английском ↗ 68,8% максимальное
DeepSWE113 долгих задач по программированию в 91 открытом проекте на пяти языках; задачи написаны с нуля и не публиковалисьEpoch нашла, что примерно в 20% задач проверка отклоняет верные решения, поэтому реальный потолок заметно ниже 100%.Подробнее на английском ↗ 69,0% максимальное
ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ 49,0% максимальное
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 16,9% максимальное
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 41,0% максимальное
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 75,4% максимальное
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 91,1% максимальное
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 87,9% максимальное

Характеристики

Вышла
14 августа
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
1 млн токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 131 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$1,40 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,26 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$4,40 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
glm-5.3

Что это за модель

GLM-5.3 — старшая модель линейки GLM от китайской лаборатории Z.ai. Она устроена как смесь экспертов: из 753 млрд параметров на каждый запрос работает лишь часть. К этому добавлено разреженное внимание, которое удешевляет обработку длинных текстов. Базовую модель Z.ai не переучивала: основа та же, что у GLM-5.2, а весь прирост получен на этапе дообучения.

По замерам Z.ai, на её внутреннем наборе задач по программированию Code Bench модель на 50% сильнее GLM-5.2 и при этом тратит меньше токенов на ответ. На Terminal-Bench 3.0, где модель работает в терминале и сама доводит задачу до конца, результат вырос с 4,6 до 28,3%. Лаборатория отдельно пишет о кибербезопасности: 84,5 балла на CyberGym, наборе тестов на поиск уязвимостей в коде. На задачах, где найденную уязвимость нужно использовать для атаки, результат вырос больше чем вдвое. По словам Z.ai, эти навыки проявились сами по мере роста дообучения, и росли они быстрее, чем там ожидали.

Модель берут для долгих рабочих сессий: многошаговой разработки, агентов, которые сами вызывают инструменты и проверяют результат, сопровождения больших проектов. Глубину рассуждений можно выбрать из трёх ступеней, от лёгкой до максимальной. Для сложного кода лаборатория советует максимальную, но на ней модель тратит больше всего токенов. Запросы принимаются в форматах API OpenAI и Anthropic, поэтому готовую обвязку под эти сервисы обычно переписывать не нужно.

Рассуждения у GLM-5.3 выключить нельзя: запрос с отключённым режимом раздумий вернёт ошибку. Картинки и другие файлы, кроме текста, модель не принимает. Веса Z.ai выложила не в день запуска, а примерно через две недели, после проверки безопасности. Лицензия у них собственная, GLM-5.3 License, вместо прежней MIT: облачным провайдерам с выручкой больше 10 млрд долларов в год, чтобы запустить модель у себя, нужна отдельная проверка безопасности от Z.ai.

Источники: Документация Z.ai по GLM-5.3, Карточка модели на Hugging Face, Анонс в блоге Z.ai

Того же уровня по индексу Epoch

Другие модели семейства

Новости о модели

  1. 01

    «Интеллект растёт экспоненциально»: Маск о малых открытых моделях, обошедших лидеров 2025 года

    Илон Маск

  2. 02

    Z.ai собрала инфраструктуру для GLM-5.3-Flash с помощью GLM-5.3

    Z.ai · X

  3. 03

    Z.ai закрутила лицензию GLM-5.3: гигантам с выручкой от 10 млрд долларов нужна её проверка

    Interconnects

  4. 04

    GLM-5.3 догнала американские модели в программировании. Натан Ламберт объясняет как

    Interconnects

все упоминания GLM-5.3 — 7 →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).