Cohere предложила оценивать качество поиска с помощью модели-судьи
Метрика качества поиска RCP-nDCG@10 засчитывает подходящие документы, которых нет в составленном людьми списке правильных ответов теста; в слепом исследовании Cohere люди чаще соглашались с ней, чем с общепринятой метрикой nDCG.

Cohere представила RCP-nDCG@10 — метрику качества поиска, в которой каждый найденный документ оценивает модель-судья1, а не заранее составленный людьми список правильных ответов.
Почему это важно: По метрике nDCG сравнивают поисковые модели в главных отраслевых рейтингах, включая MTEB2. Cohere утверждает, что nDCG не засчитывает подходящие документы, которых нет в разметке теста, и потому всё хуже различает сильные модели.
Повод: По новой метрике Cohere настраивала пятое поколение своих поисковых моделей Embed и Rerank. Embed 5, которая готовит документы компаний к смысловому поиску, она выпустила в тот же день.
Как это работает: nDCG учитывает, насколько документ подходит к запросу и как высоко он стоит в выдаче. Сама метрика ничего не оценивает, а сверяет выдачу с разметкой.
- Разметку делают люди, и проверяют они только часть документов — те, что находили прежние поисковые системы.
- Новая модель может найти подходящий документ, который никто не размечал, и nDCG его не засчитает.
- В примере Cohere из теста ViDoRe v3 документ на третьем месте выдачи дословно содержит ответ, но в разметке его нет.
Детали: RCP-nDCG@10 складывает оценку документа из двух сигналов.
- Модель-судья отвечает о каждом документе на пять вопросов «да или нет» разной строгости, одинаковых для любого запроса.
- Она же сравнивает документы группами и оценивает, с какой вероятностью каждый окажется лучше остальных.
- Сравнения задают порядок документов, а ответы на вопросы переносят его на шкалу, общую для всех запросов.
В цифрах: Cohere проверила метрику в слепом исследовании. 46 нанятых проверяющих с профильным образованием не ниже бакалавра оценивали первые пять результатов соперничающих систем, не видя ни названий, ни разметки.
- Там, где две метрики называли разных победителей, люди в 70% случаев соглашались с RCP-nDCG.
- Среди документов, которые разметка считает неподходящими, 28% люди признали полезными.
- Из документов, попавших в исследование, разметка называет подходящими 29%, люди — 60%.
Что говорят: «Модели векторных представлений становятся сильнее, и традиционные бенчмарки поиска всё хуже различают лучшие системы. Во многом дело в том, что многие потенциально подходящие документы вообще никто не оценивал», — заявил Кеннет Эневольдсен (Kenneth Enevoldsen), исследователь из Орхусского университета и главный мейнтейнер3 MTEB. Модели векторных представлений — это поисковые модели вроде Embed: они превращают тексты в наборы чисел, по которым ищут близкие по смыслу документы. По словам Эневольдсена, RCP-nDCG включат в MTEB.
Но: У метрики есть предел точности, и сами люди оценивают документы по-разному.
- Если разрыв между двумя системами по RCP-nDCG меньше примерно 0,02, её вердикт совпадает с мнением людей не чаще, чем при подбрасывании монеты; выше этого порога — в 82% случаев.
- Два проверяющих ставили одному документу одинаковую оценку по шкале от 0 до 4 лишь в 42% случаев.
Между строк: Cohere предупреждает, что по старой nDCG её новые модели не всегда будут выглядеть сильнейшими. Цель, по словам компании, — не метрика сама по себе, а качество поиска, которое видит пользователь.
Что дальше: Метод описан в препринте4 на arXiv, код и данные Cohere выкладывает на GitHub. 8 октября команда поисковых моделей компании расскажет о метрике в соцсети X.