Словарь
PPO
Proximal Policy Optimization — алгоритм обучения с подкреплением, который в 2017 году предложили исследователи OpenAI во главе с Джоном Шульманом. Он ограничивает, насколько сильно стратегия модели может измениться за один шаг обучения, поэтому обучение идёт устойчивее и его проще реализовать, чем предшественника TRPO. PPO широко применяли для обучения языковых моделей на человеческих оценках (RLHF), а на его основе появились варианты вроде GRPO.