Модель · Google
Gemini 2.5 Computer Use Preview 10-2025
Предварительная версия Google для агентов, которые сами управляют браузером по скриншотам. Её уже сменила поддержка этой функции в Gemini 3
вышла 7 октября 2025
Характеристики
- Вышла
- 7 октября 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 131 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 65 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $1,25 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $10 за миллион токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- январь 2025
- Идентификатор в API
- gemini-2.5-computer-use-preview-10-2025
Что это за модель
Gemini 2.5 Computer Use — специальная модель Google для управления компьютером: она нужна агентам, то есть программам, которые сами выполняют действия в интерфейсе. Модель собрана на базе Gemini 2.5 Pro и использует её умение понимать изображения и рассуждать. Работает она по кругу. Модель получает задачу, снимок экрана и историю прошлых шагов. В ответ она предлагает следующее действие: нажать в точку, ввести текст, прокрутить страницу или открыть адрес. Выполняет действие не сама модель, а код разработчика. Затем он делает новый снимок экрана, и круг повторяется, пока задача не будет выполнена.
Обычная Gemini 2.5 Pro так работать не обучена. Эта модель натренирована именно на работу в интерфейсах, поэтому может заполнять формы, ходить по сайтам и работать в веб-приложениях без API. По замерам Google, на бенчмарке Online-Mind2Web она выполняет правильно больше 70% задач. Компания также заявляет, что на WebVoyager и AndroidWorld модель обходит конкурентов и при этом отвечает с меньшей задержкой.
Лучше всего модель работает в браузере. Управление мобильными приложениями Google называет многообещающим, но пока не доведённым до конца. Для управления настольной операционной системой модель не оптимизирована. Позже Google добавила управление компьютером в линейку Gemini 3.x: там есть отдельные наборы действий для браузера, Android и настольных систем. У версии 2.5 остался только базовый набор команд.
Модель вышла как предварительная версия, и Google прямо предупреждает, что в ней бывают ошибки и уязвимости. Для защиты каждое предложенное действие проверяет отдельная служба безопасности. Разработчик может потребовать, чтобы модель спрашивала подтверждение перед рискованными шагами, например перед покупкой или прохождением капчи. В документации советуют запускать агента в изолированной среде, вроде виртуальной машины. Ещё там рекомендуют не давать ему доступ к важным данным и следить за шагами, которые нельзя отменить.
Источники: Анонс в блоге Google, Документация Computer Use в Gemini API
Другие модели семейства
-
Gemini 3.5 Live Translate Preview
Googleконтекст 16 тыс.$3,50 / $21
-
Nano Banana Pro
Googleконтекст 131 тыс.$2 / $120рассуждения
-
Deep Research Max Preview
Googleконтекст 131 тыс.$2 / $12рассуждения
-
Deep Research Preview
Googleконтекст 131 тыс.$2 / $12рассуждения
-
Gemini 3.1 Pro Preview
Google27-е место в Epochконтекст 1 млн$2 / $12рассуждения
-
Gemini 3.1 Pro Preview Custom Tools
Google27-е место в Epochконтекст 1 млн$2 / $12рассуждения
-
Gemini 2.5 Pro
Google76-е место в Epochконтекст 1 млн$1,25 / $10рассуждения
Данные: models.dev (MIT).