ИИтак

← Назад

Cohere предложила оценивать качество поиска с помощью модели-судьи

Метрика качества поиска RCP-nDCG@10 засчитывает подходящие документы, которых нет в составленном людьми списке правильных ответов теста; в слепом исследовании Cohere люди чаще соглашались с ней, чем с общепринятой метрикой nDCG.

Изображение: Cohere

Cohere представила RCP-nDCG@10 — метрику качества поиска, в которой каждый найденный документ оценивает модель-судья1, а не заранее составленный людьми список правильных ответов.

По метрике nDCG сравнивают поисковые модели в главных отраслевых рейтингах, включая MTEB2. Cohere утверждает, что nDCG не засчитывает подходящие документы, которых нет в разметке теста, и потому всё хуже различает сильные модели.

По новой метрике Cohere настраивала пятое поколение своих поисковых моделей Embed и Rerank. Embed 5, которая готовит документы компаний к смысловому поиску, она выпустила в тот же день.

nDCG учитывает, насколько документ подходит к запросу и как высоко он стоит в выдаче. Сама метрика ничего не оценивает, а сверяет выдачу с разметкой.

  • Разметку делают люди, и проверяют они только часть документов — те, что находили прежние поисковые системы.
  • Новая модель может найти подходящий документ, который никто не размечал, и nDCG его не засчитает.
  • В примере Cohere из теста ViDoRe v3 документ на третьем месте выдачи дословно содержит ответ, но в разметке его нет.

RCP-nDCG@10 складывает оценку документа из двух сигналов.

  • Модель-судья отвечает о каждом документе на пять вопросов «да или нет» разной строгости, одинаковых для любого запроса.
  • Она же сравнивает документы группами и оценивает, с какой вероятностью каждый окажется лучше остальных.
  • Сравнения задают порядок документов, а ответы на вопросы переносят его на шкалу, общую для всех запросов.

Cohere проверила метрику в слепом исследовании. 46 нанятых проверяющих с профильным образованием не ниже бакалавра оценивали первые пять результатов соперничающих систем, не видя ни названий, ни разметки.

  • Там, где две метрики называли разных победителей, люди в 70% случаев соглашались с RCP-nDCG.
  • Среди документов, которые разметка считает неподходящими, 28% люди признали полезными.
  • Из документов, попавших в исследование, разметка называет подходящими 29%, люди — 60%.

«Модели векторных представлений становятся сильнее, и традиционные бенчмарки поиска всё хуже различают лучшие системы. Во многом дело в том, что многие потенциально подходящие документы вообще никто не оценивал», — заявил Кеннет Эневольдсен (Kenneth Enevoldsen), исследователь из Орхусского университета и главный мейнтейнер3 MTEB. Модели векторных представлений — это поисковые модели вроде Embed: они превращают тексты в наборы чисел, по которым ищут близкие по смыслу документы. По словам Эневольдсена, RCP-nDCG включат в MTEB.

У метрики есть предел точности, и сами люди оценивают документы по-разному.

  • Если разрыв между двумя системами по RCP-nDCG меньше примерно 0,02, её вердикт совпадает с мнением людей не чаще, чем при подбрасывании монеты; выше этого порога — в 82% случаев.
  • Два проверяющих ставили одному документу одинаковую оценку по шкале от 0 до 4 лишь в 42% случаев.

Cohere предупреждает, что по старой nDCG её новые модели не всегда будут выглядеть сильнейшими. Цель, по словам компании, — не метрика сама по себе, а качество поиска, которое видит пользователь.

Метод описан в препринте4 на arXiv, код и данные Cohere выкладывает на GitHub. 8 октября команда поисковых моделей компании расскажет о метрике в соцсети X.

← Все новости