Словарь
LongMemEval
Бенчмарк для проверки долговременной памяти чат-ассистентов: вопросы к модели встроены в длинную историю прошлых диалогов с пользователем. Проверяет пять умений: извлечь нужный факт, связать сведения из разных сессий, рассуждать о времени, учесть обновлённые данные и отказаться отвечать, если нужной информации нет.