ИИтак

← Назад

Модель · Z.ai

GLM-4.5V

Устаревшая открытая модель Z.ai для работы с картинками, видео, документами и интерфейсами программ, её сменила GLM-5V-Turbo

вышла 11 августа 2025

Характеристики

Вышла
11 августа 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
64 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 16 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,60 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$1,80 за миллион токенов
Понимает
текст, изображения, видео
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
апрель 2025
Идентификатор в API
glm-4.5v

Что это за модель

GLM-4.5V — открытая модель Z.ai (Zhipu AI), которая работает со зрением и текстом. Она понимает картинки, видео и документы, а отвечает текстом. В её основе лежит текстовая модель GLM-4.5-Air. Устроена она как смесь экспертов (mixture of experts): внутри много подсетей, и на каждый токен работает только часть из них. Всего в модели 106 млрд параметров, из них на каждом шаге задействуется 12 млрд.

Предшественница в линейке, GLM-4.1V, была намного меньше: около 9 млрд параметров. По замерам лаборатории, GLM-4.5V показывает лучший результат среди открытых моделей своего размера на 42 публичных бенчмарках. Эти тесты проверяют работу с картинками, видео, документами и интерфейсами программ. Как и у текстовой GLM-4.5, рассуждения перед ответом можно выключить: тогда модель отвечает быстрее, но думает менее глубоко.

Лаборатория предлагает её для разных задач. Модель разбирает длинные документы на десятки страниц, графики и таблицы. Она делит длинное видео на части и находит в нём события. Ещё она умеет указывать, где на картинке нужный объект: возвращает координаты рамки вокруг него. По скриншоту страницы модель может написать её код. Её можно сделать агентом, который читает экран и нажимает кнопки в интерфейсе. Z.ai также называет контроль качества на производстве и помощь со школьными задачами, где текст смешан с картинками.

У модели есть ограничения, их назвала сама лаборатория. С чистым текстом она справляется хуже, чем с картинками. Иногда она рассуждает дольше, чем нужно. Бывают ошибки в HTML-коде, который она пишет, а ещё она может ошибиться, когда нужно посчитать или опознать объекты на картинке. Веса открыты по лицензии MIT, поэтому модель можно запускать у себя и использовать в коммерческих проектах. Позже у Z.ai вышли более новые модели, среди них GLM-5V-Turbo, которая тоже работает со зрением.

Источники: Карточка модели на Hugging Face, Документация Z.ai

Другие модели семейства

Новости о модели

  1. 01

    Яндекс выложил открытую базовую модель AliceAI-Foundation на 80 млрд параметров

    Яндекс · HF

все 1 новость о GLM-4 →

Данные: models.dev (MIT).