ИИтак

← Назад

Модель · Z.ai

GLM-5V-Turbo

Модель Z.ai со зрением для программирования и агентов: превращает макеты и скриншоты в код и работает с интерфейсами

вышла 1 апреля

Характеристики

Вышла
1 апреля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
200 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 131 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$1,20 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,24 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$4 за миллион токенов
Понимает
текст, изображения, видео, PDF
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Идентификатор в API
glm-5v-turbo

Что это за модель

GLM-5V-Turbo — первая мультимодальная модель Z.ai, сделанная специально для программирования. Мультимодальная значит, что она понимает не только текст, но и картинки, видео и документы. Это «зрячая» версия текстовой GLM-5-Turbo. По словам лаборатории, модель получила зрение и при этом не потеряла навыков программирования, которые были у GLM-5-Turbo. Весов модели в открытом доступе нет, она работает только через платформу Z.ai.

Изображения модель разбирает новым визуальным кодировщиком CogViT. Это блок, который переводит картинку в понятный языковой модели вид. Чтобы модель отвечала быстрее, в ней используется предсказание нескольких токенов за один шаг (multi-token prediction). Z.ai перенесла этот приём с текста на картинки и видео. На этапе дообучения с подкреплением модель тренировали на задачах больше чем 30 видов: от точных наук и видео до управления интерфейсами и программирования. Кроме того, у неё есть свои инструменты: она может обвести область на картинке рамкой, сделать скриншот и прочитать веб-страницу.

Основной сценарий — превращать макет дизайна или скриншот в готовый код интерфейса сайта или приложения. Ещё модель находит ошибки отображения: например, съехавшую вёрстку или не тот цвет. Она также умеет сама ходить по сайтам и приложениям и работает в связке с агентами Claude Code и OpenClaw. В техническом отчёте Z.ai приводит свои замеры: 94,8 балла в Design2Code (это выше, чем у Claude Opus 4.6), 75,7 в AndroidWorld и 62,3 в OSWorld — это тесты на управление телефоном и компьютером. В поиске по картинкам у неё 51,9 в BrowseComp-VL и 72,9 в MMSearch.

Слабые места лаборатория называет сама. Долгим агентным задачам мешает то, что модели трудно удерживать в контексте много картинок и скриншотов. Кроме того, результат всё сильнее зависит от среды запуска, в которой работает агент. На задачах, где нужно только писать код, модель остаётся на уровне GLM-5-Turbo, так что заметного выигрыша от неё там ждать не стоит.

Источники: Документация Z.ai о GLM-5V-Turbo, Технический отчёт на arXiv

Другие модели семейства

Данные: models.dev (MIT).