Модель · Z.ai
GLM-4.5V
Устаревшая открытая модель Z.ai для работы с картинками, видео, документами и интерфейсами программ, её сменила GLM-5V-Turbo
вышла 11 августа 2025
Характеристики
- Вышла
- 11 августа 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 64 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 16 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,60 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $1,80 за миллион токенов
- Понимает
- текст, изображения, видео
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- апрель 2025
- Идентификатор в API
- glm-4.5v
Что это за модель
GLM-4.5V — открытая модель Z.ai (Zhipu AI), которая работает со зрением и текстом. Она понимает картинки, видео и документы, а отвечает текстом. В её основе лежит текстовая модель GLM-4.5-Air. Устроена она как смесь экспертов (mixture of experts): внутри много подсетей, и на каждый токен работает только часть из них. Всего в модели 106 млрд параметров, из них на каждом шаге задействуется 12 млрд.
Предшественница в линейке, GLM-4.1V, была намного меньше: около 9 млрд параметров. По замерам лаборатории, GLM-4.5V показывает лучший результат среди открытых моделей своего размера на 42 публичных бенчмарках. Эти тесты проверяют работу с картинками, видео, документами и интерфейсами программ. Как и у текстовой GLM-4.5, рассуждения перед ответом можно выключить: тогда модель отвечает быстрее, но думает менее глубоко.
Лаборатория предлагает её для разных задач. Модель разбирает длинные документы на десятки страниц, графики и таблицы. Она делит длинное видео на части и находит в нём события. Ещё она умеет указывать, где на картинке нужный объект: возвращает координаты рамки вокруг него. По скриншоту страницы модель может написать её код. Её можно сделать агентом, который читает экран и нажимает кнопки в интерфейсе. Z.ai также называет контроль качества на производстве и помощь со школьными задачами, где текст смешан с картинками.
У модели есть ограничения, их назвала сама лаборатория. С чистым текстом она справляется хуже, чем с картинками. Иногда она рассуждает дольше, чем нужно. Бывают ошибки в HTML-коде, который она пишет, а ещё она может ошибиться, когда нужно посчитать или опознать объекты на картинке. Веса открыты по лицензии MIT, поэтому модель можно запускать у себя и использовать в коммерческих проектах. Позже у Z.ai вышли более новые модели, среди них GLM-5V-Turbo, которая тоже работает со зрением.
Источники: Карточка модели на Hugging Face, Документация Z.ai
Другие модели семейства
-
GLM-5V-Turbo
Z.aiконтекст 200 тыс.$1,20 / $4рассуждения
-
GLM-5-Turbo
Z.aiконтекст 200 тыс.$1,20 / $4рассуждения
Новости о модели
- 01
Данные: models.dev (MIT).