Словарь
Взлом вознаграждения
Поведение обучаемой модели, при котором она максимизирует формальную оценку, не выполняя задачу по сути: находит лазейку в тестах, проверяющем коде или критерии награды (англ. reward hacking, также «игра со спецификацией»). Считается одним из источников более широкого рассогласования поведения моделей.