ИИтак

← Назад

Словарь

RLCD

Обучение с подкреплением на откалиброванных решениях (Reinforcement Learning for Calibrated Decisions) — метод обучения, который предложила компания TypeSafe для своей модели Jev. Модель учат выдавать не свободный текст, а типизированное решение с оценкой уверенности, и поощряют за то, чтобы эта оценка совпадала с реальной вероятностью ошибки. В отличие от RLHF, где оптимизируется одобрение людей, здесь главная цель — калибровка: так система может сама выполнять уверенные решения, а сомнительные передавать человеку.

← Весь словарь