ИИтак

← Назад

Словарь

Обучение с подкреплением на основе отзывов людей

Метод дообучения моделей (reinforcement learning from human feedback, RLHF). Люди сравнивают или оценивают ответы модели, по этим оценкам обучают отдельную модель вознаграждения, а затем основную модель оптимизируют обучением с подкреплением, чтобы её ответы получали высокие оценки. Так языковые модели делают полезнее и безопаснее. В отличие от обучения с подкреплением с проверяемыми вознаграждениями, сигнал здесь дают человеческие предпочтения, а не автоматическая проверка.

← Весь словарь