Latest in AI

Aprender

RLHF

Explicación en lenguaje claro de RLHF, con páginas relacionadas del catálogo.

Definición

El aprendizaje por refuerzo a partir de retroalimentación humana (RLHF) es un método de postentrenamiento que orienta un modelo usando datos de preferencia de personas (o de otros modelos).

Cómo funciona

Los evaluadores comparan salidas; un modelo de recompensa o un método de preferencia directa actualiza la política. Moldea más la utilidad y la inocuidad que el conocimiento bruto.