Медицинского ИИ-агента научили отдавать сомнительные снимки на проверку
CRC-Router оценивает риск ошибки по каждой патологии на рентгенограмме и в тестах более чем вдвое сократил долю неверных выводов, которые ИИ принял без проверки.
Исследователи представили CRC-Router — открытый модуль, который решает, какие выводы по рентгенограммам грудной клетки ИИ может принять сам, а какие нужно отправить на дополнительную проверку. Препринт вышел на arXiv 25 сентября, код выложен на GitHub.
Почему это важно: медицинских ИИ-агентов, которые сами планируют шаги и вызывают нужные инструменты, пробуют в лучевой диагностике, чтобы разгрузить врачей. Ошибка такого агента может дойти до диагноза и лечения, поэтому системе нужно знать, когда остановиться.
Как это работает: по каждой патологии, которую ищет система, модуль отдельно оценивает риск ошибки.
- Пять разных нейросетей смотрят на один снимок, а модуль измеряет, насколько неуверен их общий ответ, насколько они расходятся и насколько колеблется каждая.
- Ещё один сигнал показывает, насколько снимок необычен: его яркость и текстуру сравнивают со снимками, на которых учились модели.
- Небольшая нейросеть сводит эти сигналы и сам ответ классификаторов в одну оценку вероятности, что вывод неверен.
- Порог для этой оценки подбирает метод конформного контроля риска1: что ниже порога, система принимает сама, остальное передаёт более сильной модели, другому агенту или врачу.
В цифрах: модуль проверили на открытом наборе NIH ChestX-ray14 Национальных институтов здравоохранения США — 112 120 рентгенограмм с разметкой 14 патологий. Допустимую долю ошибок, прошедших без проверки, авторы задали в 5%.
- Если принимать все ответы подряд, неверный вывод без проверки проходит в среднем в 9,2% случаев, а с CRC-Router — в 3,9%.
- Сама система при этом разбирает 91,3% случаев, на проверку уходит меньше десятой части выводов.
- Порог в 5% модуль выдержал для 13 патологий из 14, конформное предсказание — для 10, отбор по уверенности модели — для 7. Конформное предсказание выдаёт набор возможных ответов, куда верный попадает с заданной вероятностью, а контроль риска в модуле подбирает порог прямо под долю ошибок среди принятых ответов.
Интрига: на проверку уходят в основном трудные случаи. Среди отправленных снимков патология встречается в 1,5–7 раз чаще, чем во всём наборе, в зависимости от болезни.
Детали: авторы встроили модуль в MedRAX — открытого агента Университета Торонто для чтения рентгенограмм грудной клетки. Без модуля решение, принять ответ или передать дальше, в нём принимает языковая модель.
- На снимках NIH агент сам брал на себя 62,9% случаев, а доля ошибок без проверки составляла 5,7%.
- С CRC-Router охват вырос до 81,5%, а доля таких ошибок снизилась до 4,8%.
- На втором наборе, CheXpert2, она упала с 20,9% до 4,6%, а охват немного вырос; переобучать агента не пришлось.
Но: модуль проверяли на архивных снимках, а не в больнице, а опыты с MedRAX — на выборках: 10% тестовых снимков NIH и три набора по 2 000 снимков CheXpert. Один шёл на обучение нейросети, которая оценивает риск, второй — на подбор порога, третий — на итоговую проверку. Гарантия порога держится, пока новые снимки похожи на те, на которых модуль настраивали. Для пневмоторакса3 доля ошибок всё равно превысила порог — 5,9%.
Каждый сигнал модулю нужен: без любого из них система разбирает сама меньше снимков. Сильнее всего охват падает без самого ответа классификаторов, а из сигналов неуверенности — без расхождения между моделями.