Словарь
Обучение с подкреплением
Один из основных подходов машинного обучения (reinforcement learning, RL): агент действует в среде, получает за результат числовую награду и учится выбирать действия, которые приносят наибольшую награду. В отличие от обучения с учителем, правильных ответов ему заранее не показывают — он учится методом проб и ошибок. У языковых моделей это отдельный этап после предобучения, на котором развиваются рассуждения и агентные навыки.