Модель · Z.ai
GLM-5V-Turbo
Модель Z.ai со зрением для программирования и агентов: превращает макеты и скриншоты в код и работает с интерфейсами
вышла 1 апреля
Характеристики
- Вышла
- 1 апреля
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 200 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 131 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $1,20 за миллион токенов
- Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
- $0,24 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $4 за миллион токенов
- Понимает
- текст, изображения, видео, PDF
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Идентификатор в API
- glm-5v-turbo
Что это за модель
GLM-5V-Turbo — первая мультимодальная модель Z.ai, сделанная специально для программирования. Мультимодальная значит, что она понимает не только текст, но и картинки, видео и документы. Это «зрячая» версия текстовой GLM-5-Turbo. По словам лаборатории, модель получила зрение и при этом не потеряла навыков программирования, которые были у GLM-5-Turbo. Весов модели в открытом доступе нет, она работает только через платформу Z.ai.
Изображения модель разбирает новым визуальным кодировщиком CogViT. Это блок, который переводит картинку в понятный языковой модели вид. Чтобы модель отвечала быстрее, в ней используется предсказание нескольких токенов за один шаг (multi-token prediction). Z.ai перенесла этот приём с текста на картинки и видео. На этапе дообучения с подкреплением модель тренировали на задачах больше чем 30 видов: от точных наук и видео до управления интерфейсами и программирования. Кроме того, у неё есть свои инструменты: она может обвести область на картинке рамкой, сделать скриншот и прочитать веб-страницу.
Основной сценарий — превращать макет дизайна или скриншот в готовый код интерфейса сайта или приложения. Ещё модель находит ошибки отображения: например, съехавшую вёрстку или не тот цвет. Она также умеет сама ходить по сайтам и приложениям и работает в связке с агентами Claude Code и OpenClaw. В техническом отчёте Z.ai приводит свои замеры: 94,8 балла в Design2Code (это выше, чем у Claude Opus 4.6), 75,7 в AndroidWorld и 62,3 в OSWorld — это тесты на управление телефоном и компьютером. В поиске по картинкам у неё 51,9 в BrowseComp-VL и 72,9 в MMSearch.
Слабые места лаборатория называет сама. Долгим агентным задачам мешает то, что модели трудно удерживать в контексте много картинок и скриншотов. Кроме того, результат всё сильнее зависит от среды запуска, в которой работает агент. На задачах, где нужно только писать код, модель остаётся на уровне GLM-5-Turbo, так что заметного выигрыша от неё там ждать не стоит.
Источники: Документация Z.ai о GLM-5V-Turbo, Технический отчёт на arXiv
Другие модели семейства
-
GLM-5-Turbo
Z.aiконтекст 200 тыс.$1,20 / $4рассуждения
Данные: models.dev (MIT).