ИИтак

← Назад

Модель · Z.ai

GLM-4.7-Flash

Лёгкая открытая модель Z.ai для программирования и агентов, запускается на своём железе; линейка GLM-5 уже выпустила ей замену

вышла 19 января

Характеристики

Вышла
19 января
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
200 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 131 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
апрель 2025
Идентификатор в API
glm-4.7-flash

Что это за модель

GLM-4.7-Flash — малая версия линейки GLM-4.7 от Z.ai. Она построена как смесь экспертов (mixture of experts): всего в ней около 30 млрд параметров, но на каждый токен работает лишь около 3 млрд. Поэтому модель заметно легче большой GLM-4.7 и подходит для запуска на своём оборудовании. Z.ai описывает её как лёгкий вариант, который ищет баланс между качеством и затратами, и отдаёт её в своём API бесплатно. Рядом есть платная GLM-4.7-FlashX, которую компания называет быстрой и недорогой.

Лаборатория сравнивает модель с открытыми моделями того же размера. По её замерам, на SWE-bench Verified (исправление реальных ошибок в коде) GLM-4.7-Flash набирает 59,2 балла, а Qwen3-30B-A3B и GPT-OSS-20B — от 22 до 34. На GPQA (научные вопросы уровня аспирантуры) у неё 75,2, на математическом AIME 25 — 91,6, почти как у GPT-OSS-20B. Z.ai заявляет, что это лучший результат среди открытых моделей такого размера также на τ²-Bench, который проверяет работу агента с инструментами.

Модель берут для помощи в программировании, причём Z.ai отдельно выделяет разработку интерфейсов и серверной части. Её также советуют для текстов на китайском, перевода, ролевых диалогов и многошаговых сценариев, где модель вызывает инструменты. Для таких агентных задач лаборатория рекомендует включать режим, при котором рассуждения сохраняются между шагами диалога.

Веса выложены под лицензией MIT, которая почти ничем не ограничивает использование, в том числе коммерческое. На момент выхода vLLM и SGLang поддерживали модель только в разрабатываемых версиях, а не в стабильных выпусках. Теперь это модель прошлого поколения: после неё Z.ai выпустила линейку GLM-5, включая лёгкие GLM-5.3-Flash и GLM-5.3-FlashX.

Источники: Карточка модели на Hugging Face, Документация Z.ai по линейке GLM-4.7

Другие модели семейства

Данные: models.dev (MIT).