Latest in AI

Apprendre

RLHF

Explication en langage simple de RLHF, avec les pages catalogue liées.

Définition

L'apprentissage par renforcement à partir de retours humains (RLHF) est une méthode de post-entraînement qui oriente un modèle à l'aide de données de préférence provenant de personnes (ou d'autres modèles).

Comment ça marche

Des évaluateurs comparent les sorties ; un modèle de récompense ou une méthode de préférence directe met à jour la politique. Cela façonne davantage l'utilité et l'innocuité que la connaissance brute.