Словарь
DAPO
Алгоритм обучения с подкреплением для больших языковых моделей (Decoupled Clip and Dynamic sAmpling Policy Optimization), предложенный ByteDance Seed и Университетом Цинхуа как доработка GRPO. Модель генерирует несколько ответов на задачу и получает награду за правильные; DAPO добавляет раздельные границы отсечения обновлений, отбрасывание групп, где все ответы одинаково верны или неверны, усреднение потерь по токенам и штраф за слишком длинные ответы — это стабилизирует обучение длинным рассуждениям.