Leren
RLHF
Uitleg in gewone taal van RLHF, met gerelateerde cataloguspagina's.
Definitie
Reinforcement learning from human feedback (RLHF) is een post-trainingmethode die een model stuurt met voorkeursdata van mensen (of van andere modellen).
Hoe het werkt
Beoordelaars vergelijken outputs; een beloningsmodel of directe preferentiemethode werkt het beleid bij. Het vormt behulpzaamheid en onschadelijkheid meer dan ruwe kennis.