Google Research: модели ошибаются в фактах не от незнания, а оттого что не могут их вспомнить
Gemini 3 Pro и GPT-5 хранят 95–98% проверенных фактов, но без рассуждений не могут вспомнить 26–34% из них. Если модель сначала рассуждает, доля провалов падает до 11–12%.
Передовые языковые модели знают почти всё, о чём их спрашивают, но далеко не всегда могут это вспомнить. К такому выводу пришли исследователи Google Research Нитай Кальдерон (Nitay Calderon) и Галь Йона (Gal Yona). В 95–98% случаев факт хранится в «памяти» Gemini 3 Pro и GPT-5. Тем не менее при прямом вопросе модели не могут вспомнить 26–34% фактов.
Авторы сравнивают это с пустыми полками и потерянными ключами. Обычная проверка точности эти случаи не различает: неверный ответ засчитывается как ошибка, а почему он неверный, не видно. Между тем лечатся они по-разному. Пустые полки заполняют, увеличивая модель и объём данных. Потерянные ключи ищут на этапе дообучения или прямо во время ответа.
Для проверки команда собрала бенчмарк WikiProfile: 2 150 фактов из Википедии и по десять заданий к каждому. Одни задания проверяют, хранит ли модель факт. Для этого ей дают начало фразы в том виде, в каком она встречалась бы в обучающих текстах. Другие проверяют, вспоминает ли модель факт в ответ на обычный вопрос, в том числе заданный «задом наперёд». Третьи — узнаёт ли она правильный ответ среди вариантов. Исследователи прогнали 13 моделей, с рассуждениями и без, и получили около 4,5 млн ответов.
Хуже всего модели вспоминают редкие факты. Хранят они их почти так же хорошо, как популярные, а вот вспоминают заметно реже. Похожая история с «проклятием обращения»: модель знает, что A — это B, но не может ответить, что такое B. Если задать вопрос в обратную сторону с вариантами ответа, модели справляются не хуже, а часто и лучше, чем с прямым. Значит, связь в модели есть. Трудно лишь вспомнить её, когда вопрос задан не в том направлении, в каком факт встречался при обучении.
Больше всего помогают рассуждения перед ответом. В моделях, которые обучены рассуждать, они возвращают 40–65% фактов, которые модель хранит, но сразу не вспоминает. Среди фактов, которых в модели нет, удаётся «додумать» лишь 5–15%. На моделях Gemma 3 видно, что рост модели сокращает пробелы в знаниях, но с припоминанием помогает гораздо меньше.
Отсюда авторы делают вывод: дальнейший рост точности может дать скорее умение пользоваться уже накопленными знаниями, чем масштабирование. Правда, рассуждения требуют дополнительных вычислений. Как понять, когда модели стоит к ним прибегать, пока неясно.