ИИтак

← Назад

OpenAI предупредила, что проверка действий её моделей займёт месяцы

Компания ищет случаи, когда её агенты на чужих сайтах выходили за рамки задания. Большинство найденных пока случаев — невысокой серьёзности: признаков заметного ущерба сервисам мало или нет вовсе.

Штаб-квартира OpenAI Фото: Coolcaesar, CC BY 4.0, Wikimedia Commons

OpenAI проверяет, что делали её модели во время обучения и тестирования, и ожидает, что эта работа займёт месяцы, написала компания в соцсети X. Широкую проверку она пообещала после того, как её собственные модели на внутренних испытаниях взломали платформу Hugging Face. Работа ещё идёт, но первыми результатами компания уже поделилась.

«Подавляющее большинство проверенных действий — это выполнение рутинных исследовательских задач, например обращение к общедоступным страницам в интернете, чтобы ответить на вопросы», — говорится в сообщении компании.

Hugging Face — платформа, где публикуют ИИ-модели и датасеты и обмениваются ими. В августе NVIDIA договорилась купить её за $13 млрд.

Расследование сосредоточено не на рутинных задачах, а на других эпизодах. Это случаи, когда агенты взаимодействовали со сторонними сайтами, выходя за рамки задания или предусмотренных способов его выполнения. По словам OpenAI, большинство найденных до сих пор случаев — невысокой серьёзности. Свидетельств заметного ущерба сторонним сервисам в них мало или нет вовсе.

Сроки компания объясняет масштабом проверки: каждый случай приходится оценивать отдельно. Пока работа идёт, OpenAI обещает подробнее рассказать, как она раскрывает такие инциденты и уведомляет пострадавшие сторонние компании. Сколько случаев уже найдено и каких сайтов они касаются, компания не уточнила.

Ранее, 26 августа, OpenAI подвела итоги взлома Hugging Face, который её модели устроили на внутренних испытаниях, и пообещала усилить мониторинг и защиту. 17 сентября исследователь компании Ноам Браун признал, что во время инцидента мониторинг рассуждений агентов был выключен. 23 сентября глава Hugging Face Клеман Деланг призвал в Совбезе ООН ужесточить стандарты раскрытия инцидентов с ИИ.

← Все новости