Медицинская модель поиска за 14,5 часа на одной RTX 3090 обошла все универсальные
В Hugging Face показали, как дообучить многовекторную модель поиска в Sentence Transformers 6.0. Медицинская mLateOn-medical за 14,5 часа на одной RTX 3090 обошла больше 50 универсальных конфигураций.
Хорошую модель поиска под свою предметную область можно дообучить за вечер на игровой видеокарте. Это показал автор библиотеки Sentence Transformers в Hugging Face. Он опубликовал руководство по обучению многовекторных моделей1, поддержка которых появилась в версии 6.0.
Такая модель хранит отдельный маленький вектор для каждого токена текста, а не один на весь документ. Поэтому она ловит мелкие совпадения, которые обычная модель при сжатии усредняет. Для примера автор дообучил модель mLateOn-medical на миллионе пар «медицинский вопрос — фрагмент с ответом» из набора MIRIAD2. Обучение шло 14,5 часа на одной RTX 3090, пиковый расход видеопамяти — 17,5 ГБ.
В проверке 1 000 вопросов искали ответы среди 200 000 фрагментов. Модель сравнили с более чем 50 конфигурациями универсальных моделей: плотных, разреженных, многовекторных и классическим BM253. Лучшая из них ставит нужный фрагмент первым в 75,8% случаев, дообученная — в 84,9%. Мощные модели не помогли: Qwen3-Embedding-4B, у которой активных параметров примерно в 33 раза больше, отстала заметно, а версия 8B показала результат хуже 4B. Если бюджет меньше, хватит 100 тысяч пар: на них модель учится 75 минут и почти догоняет полную версию.
Попутно автор нашёл несколько неочевидных вещей. Лучше всего к новой области привыкают «сырые» версии моделей — после предобучения, но до финальной настройки на общий поиск. Готовые версии почти не улучшались. Ещё одна ловушка — длина: многие модели обрезают документ до 180–512 токенов, а средний медицинский фрагмент длиной 941 токен. Из-за обрезки качество падало сильнее, чем из-за разницы архитектур.
Главный минус многовекторного поиска — размер индекса. В исходном виде векторы этой коллекции занимают около 45 ГБ, а плотной модели нужно меньше 1 ГБ. Омар Хаттаб, создатель подхода ColBERT4, проверил сжатие модели: при сжатии в 13 раз качество снижается незначительно. Самый сжатый вариант занял 1,45 ГБ. Это меньше, чем векторы Qwen3-Embedding-8B, а качество при этом выше.
Автор оговаривается, что модель сильна только на своей области. А хороший результат BM25 объясняется тем, что вопросы MIRIAD составлены по самим фрагментам и поэтому повторяют их слова.