Anthropic выделит 5 млн долларов на независимые оценки влияния ИИ на психику людей
Anthropic запустила грантовую программу на 5 млн долларов. Независимые исследователи должны создать открытые оценки: как чат-боты влияют на благополучие пользователей. Заявки принимают до 21 сентября.
Anthropic выделит 5 млн долларов независимым исследователям, которые возьмутся измерить, как чат-боты влияют на благополучие людей. Победители получат деньги, доступ к моделям компании и техническую поддержку. Результат — открытые оценки, которыми сможет пользоваться любой разработчик.
В компании признают, что у отрасли пока нет ясных правил для таких разговоров. Непонятно, как модель должна вести себя, когда человек ищет в ней друга или обращается к ней в разгар психологического кризиса. А ИИ уже стал для многих собеседником и опорой в трудные моменты.
Проверять здесь сложнее, чем обычно. Точность ответа можно оценить по одной реплике, а вред — часто только по всему диалогу. Человек в беде может заговорить о мыслях причинить себе вред не сразу. Anthropic приводит пример: советы о диете и тренировках безобидны, пока не выясняется, что у собеседника было расстройство пищевого поведения.
Команда безопасности компании описала, какими должны быть хорошие оценки. Они должны чётко определять, что считается провалом и почему. В разработке должны участвовать клиницисты и профильные специалисты. Проверять нужно обе ошибки: и излишнюю уступчивость, и лишние отказы. Сценарии должны быть похожи на живые длинные диалоги, где риск нарастает постепенно. Автоматических оценщиков нужно сверять с мнением настоящих экспертов.
Исследователи будут работать полностью независимо от Anthropic. Заявки принимают до 21 сентября. К 5 октября отобранным авторам предложат прислать полные проекты. Сколько грантов раздадут и какого они будут размера, компания не уточняет.