ИИтак

← Назад

Челси Финн считает, что роботам не хватает общего рецепта дообучения

Челси Финн и Перри Дун из Стэнфорда считают, что надёжными роботов сделает общий для отрасли рецепт дообучения на собственном опыте, а его пока нет.

Схема метода EXPO-FT Изображение: Перри Дун, Челси Финн и соавторы, Стэнфорд

Моделям для роботов не хватает общего рецепта дообучения, какой уже есть у языковых моделей, считают Перри Дун и Челси Финн из Стэнфордского университета. Финн — профессор Стэнфорда и сооснователь стартапа Physical Intelligence1, Дун — аспирант там же.

По мнению авторов, именно дообучение делает робота надёжным. «Робот, который правильно загружает посуду в 95% случаев, будет что-нибудь разбивать каждую неделю в доме, полном стекла, питомцев и детей», — пишут они.

Дун и Финн опубликовали в блоге Дуна статью о том, что тормозит робототехнику. У языковых моделей, напоминают авторы, отрасль сошлась на общем рецепте: сильную предобученную2 модель дообучают обучением с подкреплением3 и следят за сбоями вроде взлома вознаграждения4. Роботы, по их словам, сейчас там, где языковые модели были до появления этого рецепта: «Робототехника находится почти ровно там, где было языковое моделирование: предобучение прекрасно масштабируется».

Предобучение у роботов уже есть, а не хватает второй половины — дообучения, то есть обучения модели на собственном опыте. У роботов оно устроено сложнее, чем у языковых моделей:

  • Языковая модель дёшево выдаёт тысячи ответов параллельно, а каждая попытка робота требует времени и работы настоящего оборудования.
  • Чтобы взять стакан, робот делает около 500 управляющих шагов, а оценку получает только в конце, и трудно понять, какой шаг подвёл.
  • Одна и та же команда, отданная роботу дважды, может дать немного разные движения.
  • Плохой код перехватит проверяющий, а плохое действие робота, по словам авторов, «не ждёт проверки человеком и просто случается».

Свой подход авторы показывают на методе EXPO-FT, который они с коллегами описали в мае. Модель робота предлагает несколько вариантов движения, небольшая вспомогательная модель слегка их поправляет, а оценщик выбирает вариант с наибольшими шансами на успех. Удачные действия затем усваивает сама большая модель.

Робот с EXPO-FT решал шесть задач — например, проложить гирлянду, забить бильярдный шар в лузу или вставить цветок в бутылку — и в каждой справился 30 раз из 30. На попытки в реальном мире ушло в среднем 19 минут.

Слабые места метода авторы называют сами:

  • Человек пока сильно вовлечён: он решает, удалась ли попытка, возвращает сцену в исходное положение и вмешивается по ходу работы.
  • Чем длиннее задача, тем труднее оценщику надёжно предсказывать успех.
  • Вычисления обходятся дорого: «Девятнадцать минут работы робота — это не девятнадцать минут дообучения».

«Большие закрытые языковые модели уже достаточно умны, чтобы давать роботам указания и помогать им строить и выполнять сложные планы, но сами способности роботов двигаться и видеть остаются довольно примитивными», — пишет Джек Кларк, сооснователь Anthropic, в рассылке Import AI. По его мнению, это исправят модели, созданные под движение и зрение роботов, а для них нужна как раз такая стандартизация.

Обучение с подкреплением для роботов — «пока не рецепт, а ремесло», пишут Дун и Финн. Нужен алгоритм, который не теряет устойчивости на моделях с миллиардами параметров. Ему должно хватать такого небольшого опыта, какой реально набрать на настоящем роботе. А к нему нужны общие для отрасли правила:

  • Как решать, удалась ли попытка: у языковых моделей проверяют ответ или тесты, у роботов общего способа нет.
  • Как возвращать сцену в исходное положение, чтобы робот мог попробовать снова.
  • Как человеку давать роботу отзыв и превращать этот отзыв в обучение.

← Все новости