ИИтак

← Назад

Модель · Z.ai

GLM-4.6V

Открытая модель Z.ai прошлого поколения для работы с картинками, видео и документами и для визуальных агентов

вышла 8 декабря 2025

Характеристики

Вышла
8 декабря 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
128 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 32 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,30 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,90 за миллион токенов
Понимает
текст, изображения, видео
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
апрель 2025
Идентификатор в API
glm-4.6v

Что это за модель

GLM-4.6V — мультимодальная модель Z.ai, то есть она понимает не только текст, но и изображения, видео и документы. В своей линейке на момент выхода она была старшей. Устроена как смесь экспертов (mixture of experts): всего у неё 106 млрд параметров, но на каждый шаг работает только часть из них. Рядом вышли облегчённые версии GLM-4.6V-FlashX и GLM-4.6V-Flash. У Flash 9 млрд параметров, через API Z.ai она бесплатна.

Главное, что лаборатория добавила в этой версии, — встроенный вызов инструментов прямо от картинки. Изображение, кадр видео или страницу документа можно передать инструменту как есть, без перевода в текстовое описание. Поэтому модель годится для агентов, которые смотрят на экран или документ и сами решают, что делать дальше. Z.ai заявляет, что GLM-4.6V показывает лучший результат среди моделей своего класса на двух с лишним десятках бенчмарков, включая MMBench и OCRBench.

По словам компании, за один запрос модель разбирает около 150 страниц документов, 200 слайдов или час видео. Её берут, чтобы вытаскивать данные из финансовых отчётов и таблиц, искать информацию по картинкам и собирать отчёты, находить объекты на изображениях. Ещё она умеет восстанавливать HTML и CSS по скриншоту интерфейса и готовить материалы, где текст перемежается картинками.

Ограничения разработчики называют сами. На чисто текстовых вопросах модель заметно слабее, в сложных задачах она иногда зацикливается в рассуждениях или повторяет ответ. Хуже всего ей даются подсчёт объектов и узнавание конкретных людей. Веса выложены под лицензией MIT, она разрешает и коммерческое использование. Позже Z.ai выпустила более новую визуальную модель GLM-5V-Turbo.

Источники: Документация GLM-4.6V на сайте Z.ai, Карточка модели на Hugging Face

Другие модели семейства

Новости о модели

  1. 01

    Яндекс выложил открытую базовую модель AliceAI-Foundation на 80 млрд параметров

    Яндекс · HF

все 1 новость о GLM-4 →

Данные: models.dev (MIT).