Модель · Z.ai
GLM-4.6V
Открытая модель Z.ai прошлого поколения для работы с картинками, видео и документами и для визуальных агентов
вышла 8 декабря 2025
Характеристики
- Вышла
- 8 декабря 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 128 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 32 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,30 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0,90 за миллион токенов
- Понимает
- текст, изображения, видео
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- апрель 2025
- Идентификатор в API
- glm-4.6v
Что это за модель
GLM-4.6V — мультимодальная модель Z.ai, то есть она понимает не только текст, но и изображения, видео и документы. В своей линейке на момент выхода она была старшей. Устроена как смесь экспертов (mixture of experts): всего у неё 106 млрд параметров, но на каждый шаг работает только часть из них. Рядом вышли облегчённые версии GLM-4.6V-FlashX и GLM-4.6V-Flash. У Flash 9 млрд параметров, через API Z.ai она бесплатна.
Главное, что лаборатория добавила в этой версии, — встроенный вызов инструментов прямо от картинки. Изображение, кадр видео или страницу документа можно передать инструменту как есть, без перевода в текстовое описание. Поэтому модель годится для агентов, которые смотрят на экран или документ и сами решают, что делать дальше. Z.ai заявляет, что GLM-4.6V показывает лучший результат среди моделей своего класса на двух с лишним десятках бенчмарков, включая MMBench и OCRBench.
По словам компании, за один запрос модель разбирает около 150 страниц документов, 200 слайдов или час видео. Её берут, чтобы вытаскивать данные из финансовых отчётов и таблиц, искать информацию по картинкам и собирать отчёты, находить объекты на изображениях. Ещё она умеет восстанавливать HTML и CSS по скриншоту интерфейса и готовить материалы, где текст перемежается картинками.
Ограничения разработчики называют сами. На чисто текстовых вопросах модель заметно слабее, в сложных задачах она иногда зацикливается в рассуждениях или повторяет ответ. Хуже всего ей даются подсчёт объектов и узнавание конкретных людей. Веса выложены под лицензией MIT, она разрешает и коммерческое использование. Позже Z.ai выпустила более новую визуальную модель GLM-5V-Turbo.
Источники: Документация GLM-4.6V на сайте Z.ai, Карточка модели на Hugging Face
Другие модели семейства
-
GLM-5V-Turbo
Z.aiконтекст 200 тыс.$1,20 / $4рассуждения
-
GLM-5-Turbo
Z.aiконтекст 200 тыс.$1,20 / $4рассуждения
Новости о модели
- 01
Данные: models.dev (MIT).