पाठ 16 / 27

Alignment: RLHF और Preference Optimisation

समझाएँ कि मानव पसंद मॉडल का व्यवहार कैसे ढालती है।

रैंकिंग से सीखना

SFT के बाद labs preference data जुटाते हैं: एक prompt के लिए लोग (या सावधानी से निर्देशित AI judges) बताते हैं कि दो उत्तरों में कौन बेहतर है। RLHF में एक reward model उन पसंदों का अनुमान लगाने को प्रशिक्षित होता है और फिर language model को reinforcement learning से अधिक reward पाने के लिए, मूल के पास रहते हुए, optimise किया जाता है। DPO जैसे नए तरीक़े अलग reward model के बिना सीधे preference जोड़ियों से सीखते हैं। Alignment सहायकता और सुरक्षा सुधारता है पर अपूर्ण है: मॉडल अब भी बहकाए जा सकते हैं, ज़रूरत से ज़्यादा सहमत (sycophancy) हो सकते हैं और अति-सतर्क भी।

त्वरित जाँच: Preference tuning कौन-सा डेटा उपयोग करती है?

  • सिर्फ़ images
  • सिर्फ़ कच्चे web pages
  • तुलनाएँ जो बताती हैं कि कौन-सा उत्तर बेहतर है
  • Server logs
Answer

तुलनाएँ जो बताती हैं कि कौन-सा उत्तर बेहतर है — Preference जोड़ियाँ मॉडल को सिखाती हैं कि लोग कौन-से व्यवहार पसंद करते हैं।