Словарь
GRPO
GRPO (Group Relative Policy Optimization) — алгоритм обучения с подкреплением для языковых моделей, предложенный в работе DeepSeekMath как вариант PPO. Модель порождает группу ответов на один запрос, и преимущество каждого считается относительно средней оценки по группе, поэтому отдельная модель-критик (ценностная сеть) не нужна — это экономит память и вычисления. Широко применяется при обучении рассуждающих моделей.