Словарь
Humanity's Last Exam
Бенчмарк из нескольких тысяч очень сложных вопросов экспертного уровня по математике, естественным и гуманитарным наукам; к части вопросов прилагаются изображения. Его создали Center for AI Safety и Scale AI вместе с сотнями специалистов, чтобы оценивать модели, которые почти полностью решают прежние тесты вроде MMLU. Название переводят как «Последний экзамен человечества».