Impara
RLHF
Spiegazione in linguaggio semplice di RLHF, con pagine correlate del catalogo.
Definizione
L'apprendimento per rinforzo dal feedback umano (RLHF) è un metodo di post-training che orienta un modello usando dati di preferenza da persone (o da altri modelli).
Come funziona
I valutatori confrontano gli output; un modello di ricompensa o un metodo di preferenza diretta aggiorna la policy. Modella più l'utilità e l'innocuità che la conoscenza grezza.