Google Research заставила ИИ-агентов спорить друг с другом ради поиска биомаркеров в данных с часов
Мультиагентная система Biomarker Discovery Framework ищет в данных носимых устройств признаки депрессии и инсулинорезистентности. Найденное она проверяет по 11 пунктам, а окончательное решение остаётся за людьми.
Google Research показала Biomarker Discovery Framework — систему из нескольких ИИ-агентов, которая ищет в данных с умных часов и фитнес-браслетов возможные биомаркеры болезней. На трёх выборках общим объёмом 9 279 наблюдений она предложила 41 кандидата для психического здоровья и 25 для обмена веществ.
Авторы объясняют, зачем это нужно. Часы собирают пульс и данные о сне миллионов людей, но превратить их в надёжные медицинские признаки трудно. Существующие ИИ-агенты гонятся за точностью предсказаний и легко принимают случайные совпадения за закономерность. Бывает и так, что правильный ответ незаметно просачивается в исходные данные.
Поэтому работу разбили на шесть этапов, как у исследователей-людей. Агент-координатор получает задачу обычным текстом и раздаёт её специалистам. Одни агенты изучают данные и литературу, другие строят признаки и считают статистику обычным кодом, без генерации. Затем агент-критик и агент-защитник спорят о каждом кандидате. Проверка из 11 пунктов ищет переобучение, скрытые искажения и физиологически неправдоподобные выводы, а итоговый отчёт получает эксперт.
Система не просто выбирала готовые показатели, а придумывала новые. Для депрессии главным признаком оказалась нестабильность сна: чем сильнее от ночи к ночи скачет его длительность, тем тяжелее симптомы по опроснику PHQ-8. Для инсулинорезистентности система вывела «индекс выносливости» — число шагов, делённое на пульс в покое. Связи получились скромными, и авторы прямо пишут, что это гипотезы, а не доказательство причины. Вместе с демографическими данными найденные признаки лишь немного улучшили прогноз.
Затем 15 экспертов вслепую оценили отчёты системы и трёх конкурентов, среди которых AI co-scientist от Google DeepMind и Biomni. Biomarker Discovery Framework получила самые высокие средние баллы по всем семи критериям. Из её 21 оценки две рекомендовали принять работу, восемь — принять после небольших правок. Ещё восемь требовали серьёзной доработки, три были отказами. Эксперты в среднем сохранили бы 56,9% текста системы и лишь 18,8–30,4% у конкурентов.
Стоит учесть, что сравнение устроила сама Google и что часть оценок системы шла в отдельной серии сессий. Сроков выхода инструмента за пределы исследования в сообщении нет.