ИИтак

← Назад

Словарь

DAPO

Алгоритм обучения с подкреплением для больших языковых моделей (Decoupled Clip and Dynamic sAmpling Policy Optimization), предложенный ByteDance Seed и Университетом Цинхуа как доработка GRPO. Модель генерирует несколько ответов на задачу и получает награду за правильные; DAPO добавляет раздельные границы отсечения обновлений, отбрасывание групп, где все ответы одинаково верны или неверны, усреднение потерь по токенам и штраф за слишком длинные ответы — это стабилизирует обучение длинным рассуждениям.

← Весь словарь