Sakana AI предложила проверять движения робота в симуляторе до запуска
Sakana AI и Токийский университет дали модели Google для роботов пробовать движения в симуляторе и править их по видео: среди 45 вариантов удачный находится в 73% случаев, с одной попытки — в 25%.
Исследователи Sakana AI1 и Токийского университета дали готовой модели для роботов перебирать и править движения роборуки в симуляторе. В шести задачах удачное движение стало находиться в среднем в 73% случаев вместо 25%.
Почему это важно: Обычно робота учат новому делу так: собирают демонстрации и под задачу обучают отдельную управляющую программу. Новый метод исследователей, SAIL, проверяет, можно ли обойтись готовой моделью, если дать ей больше вычислений в момент работы, а не при обучении.
Повод: Метод SAIL представят на конференции IROS 20262. Препринт вышел в марте, в сентябре авторы его обновили, а Sakana AI описала работу в блоге.
Как это работает: С первой попытки модель редко выдаёт надёжную траекторию, а небольшая ошибка в одном движении срывает всё задание. Поэтому SAIL построен как цикл проб на модели Gemini Robotics-ER 1.53, веса которой не меняли:
- Получив несколько удачных демонстраций, модель пишет целиком траекторию, по которой должна пройти роборука.
- Траекторию прогоняют в симуляторе, а вторая копия модели смотрит видео и отмечает шаг, на котором дело застопорилось.
- По этой подсказке первая модель правит траекторию, а поиск по дереву методом Монте-Карло4 решает, какие варианты развивать дальше.
- На настоящего робота отправляют только выбранную траекторию, а удачные сохраняют в архив как примеры для новых задач.
В цифрах: Шесть задач с предметами — бананом, ручкой, миской, ящиком, ноутбуком и маркером — решали в симуляторе ALOHA:
- Одна траектория без поиска находила удачное движение в среднем в 25% случаев.
- Когда модели давали перебрать 15 вариантов, доля выросла до 65%, а с 45 вариантами — до 73%.
- Простой перебор в ширину и в глубину с теми же 15 вариантами дал 51% и 37%.
Детали: На настоящей роборуке SO-101 из открытого проекта LeRobot метод проверили на одной задаче: взять кубик и положить его в миску. Сцену восстанавливали по цветному снимку и карте глубины, движение искали в симуляторе среди 15 вариантов и выполняли его: вышло в пяти попытках из шести. Так же справилась обычная управляющая программа, обученная на найденных SAIL движениях, и работала она быстрее поиска.
Но: Авторы сами называют ограничения метода:
- Робот выполняет траекторию вслепую: пока рука движется, камера её не поправляет.
- Поиск и правка вариантов в симуляторе требуют дополнительных вычислений.
- На настоящем роботе проверили одну задачу, по шесть попыток на каждый способ, поэтому нужна проверка шире.
Если шире: Авторы напоминают, что большие модели вроде GPT-6 Astra уже управляют настоящими роботами, но надёжное движение с одной попытки у них выходит не всегда. На ту же роборуку SO-101 опиралась и NVIDIA: 23 сентября она показала, как прогонять 2 048 копий симуляции робота на одной видеокарте.
Что дальше: Авторы хотят понять, что ещё готовые модели смогут сделать с такой подсказкой из симулятора и насколько улучшения переносятся на настоящих роботов.