# Alignment: RLHF और Preference Optimisation — Large Language Models

Source: https://www.geekswithgeeks.com/hi/llms/r-align

> समझाएँ कि मानव पसंद मॉडल का व्यवहार कैसे ढालती है।

## रैंकिंग से सीखना

SFT के बाद labs **preference data** जुटाते हैं: एक prompt के लिए लोग (या सावधानी से निर्देशित AI judges) बताते हैं कि दो उत्तरों में कौन बेहतर है। **RLHF** में एक **reward model** उन पसंदों का अनुमान लगाने को प्रशिक्षित होता है और फिर language model को reinforcement learning से अधिक reward पाने के लिए, मूल के पास रहते हुए, optimise किया जाता है। **DPO** जैसे नए तरीक़े अलग reward model के बिना सीधे preference जोड़ियों से सीखते हैं। Alignment सहायकता और सुरक्षा सुधारता है पर अपूर्ण है: मॉडल अब भी बहकाए जा सकते हैं, ज़रूरत से ज़्यादा सहमत (**sycophancy**) हो सकते हैं और अति-सतर्क भी।

**Quiz:** Preference tuning कौन-सा डेटा उपयोग करती है?

- [ ] सिर्फ़ images
- [ ] सिर्फ़ कच्चे web pages
- [x] तुलनाएँ जो बताती हैं कि कौन-सा उत्तर बेहतर है
- [ ] Server logs

*Answer:* तुलनाएँ जो बताती हैं कि कौन-सा उत्तर बेहतर है. Preference जोड़ियाँ मॉडल को सिखाती हैं कि लोग कौन-से व्यवहार पसंद करते हैं।
