ИИтак

← Назад

Медицинского ИИ-агента научили отдавать сомнительные снимки на проверку

CRC-Router оценивает риск ошибки по каждой патологии на рентгенограмме и в тестах более чем вдвое сократил долю неверных выводов, которые ИИ принял без проверки.

Исследователи представили CRC-Router — открытый модуль, который решает, какие выводы по рентгенограммам грудной клетки ИИ может принять сам, а какие нужно отправить на дополнительную проверку. Препринт вышел на arXiv 25 сентября, код выложен на GitHub.

медицинских ИИ-агентов, которые сами планируют шаги и вызывают нужные инструменты, пробуют в лучевой диагностике, чтобы разгрузить врачей. Ошибка такого агента может дойти до диагноза и лечения, поэтому системе нужно знать, когда остановиться.

по каждой патологии, которую ищет система, модуль отдельно оценивает риск ошибки.

  • Пять разных нейросетей смотрят на один снимок, а модуль измеряет, насколько неуверен их общий ответ, насколько они расходятся и насколько колеблется каждая.
  • Ещё один сигнал показывает, насколько снимок необычен: его яркость и текстуру сравнивают со снимками, на которых учились модели.
  • Небольшая нейросеть сводит эти сигналы и сам ответ классификаторов в одну оценку вероятности, что вывод неверен.
  • Порог для этой оценки подбирает метод конформного контроля риска1: что ниже порога, система принимает сама, остальное передаёт более сильной модели, другому агенту или врачу.

модуль проверили на открытом наборе NIH ChestX-ray14 Национальных институтов здравоохранения США — 112 120 рентгенограмм с разметкой 14 патологий. Допустимую долю ошибок, прошедших без проверки, авторы задали в 5%.

  • Если принимать все ответы подряд, неверный вывод без проверки проходит в среднем в 9,2% случаев, а с CRC-Router — в 3,9%.
  • Сама система при этом разбирает 91,3% случаев, на проверку уходит меньше десятой части выводов.
  • Порог в 5% модуль выдержал для 13 патологий из 14, конформное предсказание — для 10, отбор по уверенности модели — для 7. Конформное предсказание выдаёт набор возможных ответов, куда верный попадает с заданной вероятностью, а контроль риска в модуле подбирает порог прямо под долю ошибок среди принятых ответов.

на проверку уходят в основном трудные случаи. Среди отправленных снимков патология встречается в 1,5–7 раз чаще, чем во всём наборе, в зависимости от болезни.

авторы встроили модуль в MedRAX — открытого агента Университета Торонто для чтения рентгенограмм грудной клетки. Без модуля решение, принять ответ или передать дальше, в нём принимает языковая модель.

  • На снимках NIH агент сам брал на себя 62,9% случаев, а доля ошибок без проверки составляла 5,7%.
  • С CRC-Router охват вырос до 81,5%, а доля таких ошибок снизилась до 4,8%.
  • На втором наборе, CheXpert2, она упала с 20,9% до 4,6%, а охват немного вырос; переобучать агента не пришлось.

модуль проверяли на архивных снимках, а не в больнице, а опыты с MedRAX — на выборках: 10% тестовых снимков NIH и три набора по 2 000 снимков CheXpert. Один шёл на обучение нейросети, которая оценивает риск, второй — на подбор порога, третий — на итоговую проверку. Гарантия порога держится, пока новые снимки похожи на те, на которых модуль настраивали. Для пневмоторакса3 доля ошибок всё равно превысила порог — 5,9%.

Каждый сигнал модулю нужен: без любого из них система разбирает сама меньше снимков. Сильнее всего охват падает без самого ответа классификаторов, а из сигналов неуверенности — без расхождения между моделями.

← Все новости