# मॉडल का जीवन: Pretraining से Chat तक — Large Language Models

Source: https://www.geekswithgeeks.com/hi/llms/f-lifecycle

> Pretraining, instruction tuning और alignment का क्रम समझें।

## तीन व्यापक चरण

(1) **Pretraining**: मॉडल खरबों tokens का पाठ पढ़कर अगला token अनुमानित करना सीखता है; यह सबसे महँगा चरण है और **base model** देता है जो पाठ आगे बढ़ाता है पर निर्देश अच्छी तरह नहीं मानता। (2) **Supervised fine-tuning (SFT)**: निर्देशों और अच्छे उत्तरों के चुने हुए उदाहरणों पर प्रशिक्षण ताकि मॉडल सहायक की तरह व्यवहार करे। (3) **Preference tuning / alignment** (RLHF, DPO और संबंधित तरीक़े): इंसान या AI judges उत्तरों की रैंकिंग करते हैं और मॉडल को सहायक, ईमानदार और हानिरहित उत्तरों की ओर धकेला जाता है। विशिष्ट विधियाँ labs के बीच अलग हैं और जल्दी बदलती हैं, पर यह समग्र ढाँचा आम है।

## चरण एक नज़र में

हर चरण बदलता है कि मॉडल किसमें अच्छा है।

```text
Stage              Data                         Result
Pretraining        web, books, code (trillions)  base model: fluent, knows a lot, ignores instructions
SFT                instruction/answer pairs      follows instructions, chat format
Preference tuning  ranked answers                more helpful, safer, better tone
Deployment         prompts + tools + retrieval   the product users see
```

## Base बनाम chat मॉडल

कई providers दोनों देते हैं। सहायकों के लिए chat या instruct संस्करण लें, और base तभी जब कच्चा पाठ-विस्तार चाहिए या ख़ुद tune करना हो।

**Quiz:** कौन-सा चरण आम तौर पर सबसे महँगा है?

- [x] Pretraining
- [ ] Prompt लिखना
- [ ] UI render करना
- [ ] Spell checking

*Answer:* Pretraining. Pretraining डेटा और मॉडल के आकार के कारण अधिकांश compute खाता है।
