ИИтак

← Назад

В Цинхуа обучили модель ставить диагнозы традиционной китайской медицины

LingLan-14B дообучили на 120 тыс. врачебных записей с описаниями языка и пульса. Верный диагноз она ставит в 62,7% случаев — вдвое чаще, чем исходная Qwen3-14B.

Исследователи из Университета Цинхуа и Гуандунской провинциальной лаборатории традиционной китайской медицины обучили языковую модель LingLan-14B ставить диагнозы по правилам этой медицины, говорится в препринте на arXiv. Модель получает описание языка и пульса пациента вместе с его жалобами и называет диагноз.

Традиционная китайская медицина опирается на четыре приёма: осмотр, выслушивание и обоняние, расспрос и ощупывание, включая оценку пульса. Врач смотрит на цвет языка и налёт, определяет тип пульса и по совокупности признаков относит состояние пациента к тому или иному синдрому. По словам авторов, такие оценки субъективны и плохо поддаются стандартизации, поэтому ИИ приходит в эту область медленнее, чем в обычную медицину.

Основа работы — система UFMD, которая сводит разнородные данные в единую цифровую запись. Снимки языка и изображения пульсовой волны она переводит в стандартные формулировки вроде «бледно-красный язык, тонкий белый налёт» или «струнный пульс». Бумажные медкарты, в том числе рукописные, распознаёт модель DeepSeek-OCR1. Чтобы отловить выдуманные при распознавании данные, извлечённый текст сравнивают по смыслу с исходным и помечают записи, где сходство ниже порога. Затем результаты вручную проверяли эксперты. Так обработали более 120 тыс. клинических записей.

Сама LingLan-14B — версия открытой модели Qwen3-14B от Alibaba. Её дообучили методом LoRA, при котором меняется лишь небольшая надстройка над весами, а не вся модель. Обучение заняло 12 часов на одной видеокарте Nvidia RTX 5090. Специализированная модель для китайской медицины BianCang-14B-Instruct, с которой сравнивали LingLan, по данным авторов, обучалась 605 часов на восьми Nvidia A100.

Проверяли модель на 20% записей, не участвовавших в обучении. Диагнозы в них размечены по национальному стандарту Китая GB/T 15657-2021. LingLan-14B ставила верный диагноз в 62,7% случаев, исходная Qwen3-14B — в 30,8%, отсюда заявленный авторами прирост на 103,5%.

Полнота2 и F1-мера3 измеряют другое. Полнота показывает, какую долю настоящих случаев каждого диагноза модель распознала: у LingLan-14B она составила 82%, у BianCang-14B-Instruct — 69,5%. F1-мера объединяет полноту с точностью, то есть с долей верных среди диагнозов, которые назвала модель, и тоже достигла 82%. Точность в F1-мере — не то же, что доля верных диагнозов по всем записям, а как 82% соотносятся с 62,7%, авторы не поясняют. По словам исследователей, LingLan обошла по всем показателям и более крупные открытые модели, включая DeepSeek-R1.

Структура данных, как утверждают авторы, играет ключевую роль. Та же Qwen3-14B, дообученная на исходных записях без обработки в UFMD, показала заметно худшие результаты.

Веса LingLan-14B исследователи обещают выложить после принятия статьи к публикации. Набор данных закрыт, так как содержит личные сведения пациентов; обезличенную версию авторы надеются опубликовать после проверки на соответствие требованиям приватности. Закрытые коммерческие модели в сравнение не вошли: их не удалось проверить из-за ограничений по кибербезопасности.

← Все новости