Latest in AI

Impara

RLHF

Spiegazione in linguaggio semplice di RLHF, con pagine correlate del catalogo.

Definizione

L'apprendimento per rinforzo dal feedback umano (RLHF) è un metodo di post-training che orienta un modello usando dati di preferenza da persone (o da altri modelli).

Come funziona

I valutatori confrontano gli output; un modello di ricompensa o un metodo di preferenza diretta aggiorna la policy. Modella più l'utilità e l'innocuità che la conoscenza grezza.