Apprendre
RLHF
Explication en langage simple de RLHF, avec les pages catalogue liées.
Définition
L'apprentissage par renforcement à partir de retours humains (RLHF) est une méthode de post-entraînement qui oriente un modèle à l'aide de données de préférence provenant de personnes (ou d'autres modèles).
Comment ça marche
Des évaluateurs comparent les sorties ; un modèle de récompense ou une méthode de préférence directe met à jour la politique. Cela façonne davantage l'utilité et l'innocuité que la connaissance brute.