ИИтак

← Назад

Модель · Google

Gemini Robotics ER 2

Модель-планировщик Google DeepMind для роботов, пока в предварительной версии: разбирает задачу на шаги и следит за работой по видео

вышла 30 июля

Характеристики

Вышла
30 июля
Понимает
текст, изображения, видео
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Идентификатор в API
gemini-robotics-er-2

Что это за модель

Gemini Robotics ER 2 — модель воплощённых рассуждений (embodied reasoning) из линейки Gemini Robotics. Так называют умение понимать физический мир и действовать в нём. Google называет её «мозгом верхнего уровня» для робота. Она разговаривает с человеком, понимает, что происходит вокруг, и разбивает задачу на шаги. Сами движения выполняет другая модель: ER 2 передаёт команды модели «зрение — язык — действие» (VLA), которая управляет моторами. Модель может вызывать внешние инструменты: поиск Google, календарь и функции, которые задал разработчик.

Главное отличие от ER 1.6 — работа с видео. Прежние версии судили о ходе работы по отдельным снимкам. ER 2 смотрит непрерывный видеопоток, видит, на каком этапе робот, находит моменты перехода между шагами и понимает, когда задача выполнена. Это позволяет роботу поправлять себя по ходу дела. Через Gemini Live API, интерфейс для потокового обмена данными в реальном времени, модель отвечает меньше чем за секунду. Кроме того, она умеет распределять работу между несколькими разными роботами. По замерам лаборатории, на тесте вопросов о физическом мире ERQA модель набирает 78,5%, а моменты перехода находит с точностью 91,3%.

Модель берут разработчики роботов, которым нужно связать голосовую команду человека с многошаговой работой машины. В демонстрациях Google робот Spot от Boston Dynamics приносит вещи по просьбе, заданной обычными словами, а гуманоид Apptronik Apollo 2 и двурукий Franka F3 Duo делят работу между собой. Модель также научилась снимать показания с приборов: не только со стрелочных циферблатов, но и с цифровых экранов, линеек и термометров.

Отдельно Google говорит о безопасности. Модель лучше соблюдает заданные физические ограничения. Она замечает человека, который подошёл слишком близко, останавливает робота и продолжает работу, когда место освободится. На собственном тесте лаборатории по следованию правилам безопасности она показала 97,9%. При этом ER 2 не управляет моторами сама: ей нужна отдельная модель-исполнитель. Пока это предварительная версия: в Gemini API и Google AI Studio она открыта всем, а на Gemini Enterprise Agent Platform — только по приглашениям.

Источники: Анонс Gemini Robotics ER 2 в блоге Google, Страница модели на сайте DeepMind, Анонс линейки Gemini Robotics 2

Новости о модели

  1. 01

    Gemini Robotics ER 2: «мозг» для роботов понимает по видео, когда задача выполнена

    Google для разработчиков

  2. 02

    Gemini Robotics 2: модели DeepMind научили гуманоида ходить и завязывать узлы

    Google DeepMind

все 2 новости о Gemini Robotics ER 2 →

Данные: models.dev (MIT).