ИИтак

← Назад

Модель · Google

Gemini 2.5 Computer Use Preview 10-2025

Предварительная версия Google для агентов, которые сами управляют браузером по скриншотам. Её уже сменила поддержка этой функции в Gemini 3

вышла 7 октября 2025

Характеристики

Вышла
7 октября 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
131 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 65 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$1,25 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$10 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
январь 2025
Идентификатор в API
gemini-2.5-computer-use-preview-10-2025

Что это за модель

Gemini 2.5 Computer Use — специальная модель Google для управления компьютером: она нужна агентам, то есть программам, которые сами выполняют действия в интерфейсе. Модель собрана на базе Gemini 2.5 Pro и использует её умение понимать изображения и рассуждать. Работает она по кругу. Модель получает задачу, снимок экрана и историю прошлых шагов. В ответ она предлагает следующее действие: нажать в точку, ввести текст, прокрутить страницу или открыть адрес. Выполняет действие не сама модель, а код разработчика. Затем он делает новый снимок экрана, и круг повторяется, пока задача не будет выполнена.

Обычная Gemini 2.5 Pro так работать не обучена. Эта модель натренирована именно на работу в интерфейсах, поэтому может заполнять формы, ходить по сайтам и работать в веб-приложениях без API. По замерам Google, на бенчмарке Online-Mind2Web она выполняет правильно больше 70% задач. Компания также заявляет, что на WebVoyager и AndroidWorld модель обходит конкурентов и при этом отвечает с меньшей задержкой.

Лучше всего модель работает в браузере. Управление мобильными приложениями Google называет многообещающим, но пока не доведённым до конца. Для управления настольной операционной системой модель не оптимизирована. Позже Google добавила управление компьютером в линейку Gemini 3.x: там есть отдельные наборы действий для браузера, Android и настольных систем. У версии 2.5 остался только базовый набор команд.

Модель вышла как предварительная версия, и Google прямо предупреждает, что в ней бывают ошибки и уязвимости. Для защиты каждое предложенное действие проверяет отдельная служба безопасности. Разработчик может потребовать, чтобы модель спрашивала подтверждение перед рискованными шагами, например перед покупкой или прохождением капчи. В документации советуют запускать агента в изолированной среде, вроде виртуальной машины. Ещё там рекомендуют не давать ему доступ к важным данным и следить за шагами, которые нельзя отменить.

Источники: Анонс в блоге Google, Документация Computer Use в Gemini API

Другие модели семейства

Данные: models.dev (MIT).