ИИтак

← Назад

Модель · Z.ai

GLM-4.7

Устаревшая модель Z.ai с открытыми весами для программирования и агентных задач, её сменила линейка GLM-5

вышла 22 декабря 2025

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

87 место из 266
индекс 143, вероятный разброс 142–145 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
CL-bench LifeЗадачи, которые решаются только по данным из запроса: групповые чаты, личные заметки, истории покупок и браузераПодробнее на английском ↗ 10,9%
CL-benchУмение выучить новое прямо из длинного текста: вымышленные законы, языки программирования, правила — и решить по ним задачиЗадача засчитывается, только если ответ проходит все проверочные критерии экспертов, поэтому даже лидеры решают около четверти.Подробнее на английском ↗ 15,9%
ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ 6,0%
APEX-Agents480 многошаговых рабочих задач из инвестбанкинга, консалтинга и корпоративного права: агент работает с файлами, почтой, таблицамиЗадача засчитывается, только если выполнены все пункты экспертного списка критериев; проверяет их другая модель.Подробнее на английском ↗ 8,7%
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 1,1%
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 32,2%
FrontierMath-Tier-4-2025-07-01-PrivateСамый сложный уровень FrontierMath: исследовательские задачи по математике, на которые у математика уходят часы или дниРезультат посчитан на закрытом наборе задач версии от июля 2025 года; в 2026 году вышла исправленная версия, и числа двух версий не сравнимы.Подробнее на английском ↗ 0,0%
Terminal BenchЗадачи в командной строке по мотивам реальной работы: агент сам выполняет их в терминале, результат проверяют автотестыПодробнее на английском ↗ 33,4%
FrontierMath-2025-02-28-PrivateНеопубликованные задачи FrontierMath (уровни 1–3) в версии от 28.02.2025: трудная математика, над которой специалист сидит часамиПодробнее на английском ↗ 4,3%
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 83,3%
SimpleBenchВопросы с подвохом на здравый смысл: пространство, время, поведение людей. 213 вопросов, у каждого шесть вариантов ответаЛюди в проверке авторов набрали около 84%, а балл модели — средняя точность по пяти прогонам.Подробнее на английском ↗ 37,2%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 77,8%

Характеристики

Вышла
22 декабря 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
204 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 131 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,60 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,11 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$2,20 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
апрель 2025
Идентификатор в API
glm-4.7

Что это за модель

GLM-4.7 — языковая модель китайской лаборатории Z.ai (бывшая Zhipu), рассчитанная на программирование и многошаговые рассуждения. Она построена по схеме смеси экспертов (mixture of experts): всего в ней 358 млрд параметров, но на каждый токен работает только часть из них. Поэтому она отвечает быстрее и дешевле, чем плотная модель того же размера. Рядом с ней лаборатория выпустила облегчённые версии GLM-4.7-FlashX и бесплатную GLM-4.7-Flash.

По сравнению с GLM-4.6 лаборатория улучшила прежде всего программирование и работу агентов. По её замерам, модель набирает 73,8% в SWE-bench Verified (на 5,8 пункта больше, чем у предшественницы) и 41% в Terminal Bench 2.0 (плюс 16,5 пункта). В тесте на вызов инструментов τ²-Bench она показывает 87,4%, а в Humanity's Last Exam с инструментами — 42,8%. Компания заявляет, что в задачах программирования модель выходит на уровень Claude Sonnet 4.5.

В GLM-4.7 появилось три режима рассуждений. Модель может думать перед каждым ответом и каждым вызовом инструмента, может сохранять свои рассуждения между репликами длинного диалога, а рассуждения можно включать и выключать для отдельных реплик: выключать для простых вопросов и включать для сложных. Её берут для агентного программирования, когда модель сама правит код и запускает команды в терминале, а ещё для вёрстки веб-интерфейсов, презентаций и постеров. Лаборатория отдельно отмечает, что модель стала лучше писать код на разных языках и делать более аккуратный внешний вид интерфейсов.

Веса модели выложены под лицензией MIT: её можно запускать на своих серверах и использовать в коммерческих продуктах. Но для запуска такого размера нужно серьёзное серверное оборудование. Модель работает только с текстом. Сейчас её сменила линейка GLM-5, и у Z.ai вышло уже несколько более новых версий.

Источники: Документация GLM-4.7 на сайте Z.ai, Карточка модели на Hugging Face

Того же уровня по индексу Epoch

Другие модели семейства

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).