Челси Финн считает, что роботам не хватает общего рецепта дообучения
Челси Финн и Перри Дун из Стэнфорда считают, что надёжными роботов сделает общий для отрасли рецепт дообучения на собственном опыте, а его пока нет.

Моделям для роботов не хватает общего рецепта дообучения, какой уже есть у языковых моделей, считают Перри Дун и Челси Финн из Стэнфордского университета. Финн — профессор Стэнфорда и сооснователь стартапа Physical Intelligence1, Дун — аспирант там же.
Почему это важно: По мнению авторов, именно дообучение делает робота надёжным. «Робот, который правильно загружает посуду в 95% случаев, будет что-нибудь разбивать каждую неделю в доме, полном стекла, питомцев и детей», — пишут они.
Повод: Дун и Финн опубликовали в блоге Дуна статью о том, что тормозит робототехнику. У языковых моделей, напоминают авторы, отрасль сошлась на общем рецепте: сильную предобученную2 модель дообучают обучением с подкреплением3 и следят за сбоями вроде взлома вознаграждения4. Роботы, по их словам, сейчас там, где языковые модели были до появления этого рецепта: «Робототехника находится почти ровно там, где было языковое моделирование: предобучение прекрасно масштабируется».
Детали: Предобучение у роботов уже есть, а не хватает второй половины — дообучения, то есть обучения модели на собственном опыте. У роботов оно устроено сложнее, чем у языковых моделей:
- Языковая модель дёшево выдаёт тысячи ответов параллельно, а каждая попытка робота требует времени и работы настоящего оборудования.
- Чтобы взять стакан, робот делает около 500 управляющих шагов, а оценку получает только в конце, и трудно понять, какой шаг подвёл.
- Одна и та же команда, отданная роботу дважды, может дать немного разные движения.
- Плохой код перехватит проверяющий, а плохое действие робота, по словам авторов, «не ждёт проверки человеком и просто случается».
Как это работает: Свой подход авторы показывают на методе EXPO-FT, который они с коллегами описали в мае. Модель робота предлагает несколько вариантов движения, небольшая вспомогательная модель слегка их поправляет, а оценщик выбирает вариант с наибольшими шансами на успех. Удачные действия затем усваивает сама большая модель.
В цифрах: Робот с EXPO-FT решал шесть задач — например, проложить гирлянду, забить бильярдный шар в лузу или вставить цветок в бутылку — и в каждой справился 30 раз из 30. На попытки в реальном мире ушло в среднем 19 минут.
Но: Слабые места метода авторы называют сами:
- Человек пока сильно вовлечён: он решает, удалась ли попытка, возвращает сцену в исходное положение и вмешивается по ходу работы.
- Чем длиннее задача, тем труднее оценщику надёжно предсказывать успех.
- Вычисления обходятся дорого: «Девятнадцать минут работы робота — это не девятнадцать минут дообучения».
Что говорят: «Большие закрытые языковые модели уже достаточно умны, чтобы давать роботам указания и помогать им строить и выполнять сложные планы, но сами способности роботов двигаться и видеть остаются довольно примитивными», — пишет Джек Кларк, сооснователь Anthropic, в рассылке Import AI. По его мнению, это исправят модели, созданные под движение и зрение роботов, а для них нужна как раз такая стандартизация.
Что дальше: Обучение с подкреплением для роботов — «пока не рецепт, а ремесло», пишут Дун и Финн. Нужен алгоритм, который не теряет устойчивости на моделях с миллиардами параметров. Ему должно хватать такого небольшого опыта, какой реально набрать на настоящем роботе. А к нему нужны общие для отрасли правила:
- Как решать, удалась ли попытка: у языковых моделей проверяют ответ или тесты, у роботов общего способа нет.
- Как возвращать сцену в исходное положение, чтобы робот мог попробовать снова.
- Как человеку давать роботу отзыв и превращать этот отзыв в обучение.