ИИтак

← Назад

словарь

Прямая оптимизация предпочтений

Метод дообучения языковой модели на парах ответов, где один ответ отмечен как предпочтительный, а другой как отвергнутый (Direct Preference Optimization, DPO). Модель учится повышать вероятность предпочтительных ответов относительно исходной эталонной модели. В отличие от обучения с подкреплением на основе отзывов людей (RLHF), ей не нужны отдельная модель вознаграждения и цикл обучения с подкреплением: всё сводится к одному этапу обучения, похожему на обычное обучение с учителем.

В новостях

  1. Ai2 выложил открытую модель AstaBrief для научных отчётов со ссылками

    Способ дообучить языковую модель на парах ответов, где один отмечен как лучший. Модель учится чаще давать ответы вроде предпочтённых, и отдельная модель-оценщик для этого не нужна.