ИИтак

← Назад

Словарь

Обучение с подкреплением с проверяемыми вознаграждениями

Обучение с подкреплением с проверяемыми вознаграждениями (reinforcement learning with verifiable rewards, RLVR) — способ дообучения моделей, при котором награда начисляется автоматически по объективно проверяемому результату: прохождению тестов, совпадению с эталонным ответом, корректности вычисления. Отличается от обучения на оценках людей или на модели вознаграждения тем, что сигнал даёт детерминированная проверка, что снижает риск «подгонки» под вкусы оценщика.

← Весь словарь