ИИтак

← Назад

Amazon выпустила PatientAgentBench — бенчмарк для медицинских ИИ-агентов, общающихся с пациентами

PatientAgentBench проверяет ИИ-агентов в долгих разговорах с виртуальными пациентами. Главный вывод: модели лучше справляются с явными экстренными случаями, чем с рутинными просьбами, за которыми скрывается реальный риск.

Исследователи Amazon представили PatientAgentBench — открытый бенчмарк для ИИ-агентов, которые общаются с пациентами напрямую: записывают на приём, помогают с рецептами, оценивают, насколько срочно нужна помощь. Код фреймворка выложен на GitHub, подробности опубликованы в научной статье.

Авторы объясняют, зачем понадобился ещё один тест. Существующие медицинские бенчмарки либо проверяют знания, как на экзамене: один вопрос — один ответ, либо тестируют агентов с инструментами, но на технических задачах для врачей, а не в разговоре с пациентом. Ни один не проверяет, как система ведёт многоходовой диалог, читает медкарту и решает, когда расспросить подробнее, когда действовать, а когда передать случай врачу. Кроме того, привычные критерии оценки врачи пишут под конкретный набор диалогов. После публикации такой набор попадает в обучающие данные, и модель может просто запомнить правильные ответы.

PatientAgentBench устроен иначе. Для каждого сценария он генерирует синтетическую медкарту пациента, клиническую историю на её основе и агента-«пациента», который разговаривает с проверяемой системой. Проверяемый агент — это базовая модель с обвязкой, которая работает с симулированными медицинскими инструментами: они помнят, что уже было сделано. Разговор оценивает жюри из нескольких языковых моделей по более чем 100 критериям, одобренным врачами. Критерии разбиты на шесть групп: клиническая безопасность, медицинская сортировка пациентов по срочности, правильность выполнения процедур, доведение задачи до конца, польза и качество общения. Критерии универсальны, а сценарии генерируются заново, поэтому готовых ответов, которые можно заучить, нет. Лицензированные врачи вручную разметили часть диалогов. По словам авторов, их оценки совпали с оценками жюри не хуже, чем оценки врачей между собой. Жюри при этом скорее поднимет ложную тревогу, чем пропустит реальную проблему. Настоящие данные пациентов нигде не используются.

Авторы прогнали через бенчмарк несколько семейств передовых моделей на тысячах диалогов. Даже сильнейшие модели в базовой обвязке не дотянули до уровня, которого требует работа с пациентами. Сильнее всего модели расходились в медицинской сортировке, и здесь обнаружился «парадокс тяжести»: явная экстренная ситуация включает защитные механизмы, поэтому с ней агенты справляются лучше, чем с рутиной. Самыми трудными оказались обычные административные просьбы от сложных пациентов — например, обновить данные аптеки при нескольких препаратах и задокументированной проблеме с психическим здоровьем. Большинство моделей просто выполняли просьбу и не проверяли, нет ли клинического риска.

Среди нарушений безопасности чаще всего встречалось упущение кризисных ресурсов: модель распознаёт суицидальные мысли, но не даёт номер телефона доверия. На втором месте — выдумки: несуществующая квалификация врачей, ложные ссылки на источники, отчёты о действиях, которые агент на самом деле не выполнял. Более сильные модели сокращают разрыв, но не закрывают его. Авторы делают вывод, что одной мощности модели для клинической безопасности мало и недостающее должна восполнять архитектура агента.

В открытый код вошли генератор сценариев, медицинская песочница с инструментами, модуль для запуска диалога двух агентов и система оценки с запросами для всех шести групп критериев. Готового набора данных нет: сценарии генерируются по требованию из настраиваемого распределения характеристик пациентов. Поэтому команды могут разбивать результаты по подгруппам пациентов. Какие именно модели тестировались и какие баллы они получили, в анонсе не сказано.

← Все новости