ИИтак

← Назад

Sakana AI предложила проверять движения робота в симуляторе до запуска

Sakana AI и Токийский университет дали модели Google для роботов пробовать движения в симуляторе и править их по видео: среди 45 вариантов удачный находится в 73% случаев, с одной попытки — в 25%.

Исследователи Sakana AI1 и Токийского университета дали готовой модели для роботов перебирать и править движения роборуки в симуляторе. В шести задачах удачное движение стало находиться в среднем в 73% случаев вместо 25%.

Обычно робота учат новому делу так: собирают демонстрации и под задачу обучают отдельную управляющую программу. Новый метод исследователей, SAIL, проверяет, можно ли обойтись готовой моделью, если дать ей больше вычислений в момент работы, а не при обучении.

Метод SAIL представят на конференции IROS 20262. Препринт вышел в марте, в сентябре авторы его обновили, а Sakana AI описала работу в блоге.

С первой попытки модель редко выдаёт надёжную траекторию, а небольшая ошибка в одном движении срывает всё задание. Поэтому SAIL построен как цикл проб на модели Gemini Robotics-ER 1.53, веса которой не меняли:

  • Получив несколько удачных демонстраций, модель пишет целиком траекторию, по которой должна пройти роборука.
  • Траекторию прогоняют в симуляторе, а вторая копия модели смотрит видео и отмечает шаг, на котором дело застопорилось.
  • По этой подсказке первая модель правит траекторию, а поиск по дереву методом Монте-Карло4 решает, какие варианты развивать дальше.
  • На настоящего робота отправляют только выбранную траекторию, а удачные сохраняют в архив как примеры для новых задач.

Шесть задач с предметами — бананом, ручкой, миской, ящиком, ноутбуком и маркером — решали в симуляторе ALOHA:

  • Одна траектория без поиска находила удачное движение в среднем в 25% случаев.
  • Когда модели давали перебрать 15 вариантов, доля выросла до 65%, а с 45 вариантами — до 73%.
  • Простой перебор в ширину и в глубину с теми же 15 вариантами дал 51% и 37%.

На настоящей роборуке SO-101 из открытого проекта LeRobot метод проверили на одной задаче: взять кубик и положить его в миску. Сцену восстанавливали по цветному снимку и карте глубины, движение искали в симуляторе среди 15 вариантов и выполняли его: вышло в пяти попытках из шести. Так же справилась обычная управляющая программа, обученная на найденных SAIL движениях, и работала она быстрее поиска.

Авторы сами называют ограничения метода:

  • Робот выполняет траекторию вслепую: пока рука движется, камера её не поправляет.
  • Поиск и правка вариантов в симуляторе требуют дополнительных вычислений.
  • На настоящем роботе проверили одну задачу, по шесть попыток на каждый способ, поэтому нужна проверка шире.

Авторы напоминают, что большие модели вроде GPT-6 Astra уже управляют настоящими роботами, но надёжное движение с одной попытки у них выходит не всегда. На ту же роборуку SO-101 опиралась и NVIDIA: 23 сентября она показала, как прогонять 2 048 копий симуляции робота на одной видеокарте.

Авторы хотят понять, что ещё готовые модели смогут сделать с такой подсказкой из симулятора и насколько улучшения переносятся на настоящих роботов.

← Все новости