Прямая оптимизация предпочтений
Метод дообучения языковой модели на парах ответов, где один ответ отмечен как предпочтительный, а другой как отвергнутый (Direct Preference Optimization, DPO). Модель учится повышать вероятность предпочтительных ответов относительно исходной эталонной модели. В отличие от обучения с подкреплением на основе отзывов людей (RLHF), ей не нужны отдельная модель вознаграждения и цикл обучения с подкреплением: всё сводится к одному этапу обучения, похожему на обычное обучение с учителем.
проверено по: arxiv.org ↗
В новостях
Ai2 выложил открытую модель AstaBrief для научных отчётов со ссылками
Способ дообучить языковую модель на парах ответов, где один отмечен как лучший. Модель учится чаще давать ответы вроде предпочтённых, и отдельная модель-оценщик для этого не нужна.