Latest in AI

Lernen

RLHF

Erklärung von RLHF in klarer Sprache, mit verwandten Katalogseiten.

Definition

Reinforcement Learning from Human Feedback (RLHF) ist eine Post-Training-Methode, die ein Modell mit Präferenzdaten von Menschen (oder anderen Modellen) steuert.

So funktioniert es

Bewertende vergleichen Ausgaben; ein Reward-Modell oder eine direkte Präferenzmethode aktualisiert die Policy. Es formt Hilfsbereitschaft und Harmlosigkeit stärker als Rohwissen.