Latest in AI

Leren

RLHF

Uitleg in gewone taal van RLHF, met gerelateerde cataloguspagina's.

Definitie

Reinforcement learning from human feedback (RLHF) is een post-trainingmethode die een model stuurt met voorkeursdata van mensen (of van andere modellen).

Hoe het werkt

Beoordelaars vergelijken outputs; een beloningsmodel of directe preferentiemethode werkt het beleid bij. Het vormt behulpzaamheid en onschadelijkheid meer dan ruwe kennis.