Latest in AI

Öğren

RLHF

RLHF için sade dilli açıklama, ilgili katalog sayfalarıyla.

Tanım

İnsan geri bildiriminden pekiştirmeli öğrenme (RLHF), bir modeli insanların (veya diğer modellerin) tercih verisiyle yönlendiren bir eğitim sonrası yöntemdir.

Nasıl çalışır

Değerlendiriciler çıktıları karşılaştırır; bir ödül modeli veya doğrudan tercih yöntemi politikayı günceller. Ham bilgiden çok yardımseverliği ve zararsızlığı şekillendirir.