पाठ 2 / 27
मॉडल का जीवन: Pretraining से Chat तक
Pretraining, instruction tuning और alignment का क्रम समझें।
तीन व्यापक चरण
(1) Pretraining: मॉडल खरबों tokens का पाठ पढ़कर अगला token अनुमानित करना सीखता है; यह सबसे महँगा चरण है और base model देता है जो पाठ आगे बढ़ाता है पर निर्देश अच्छी तरह नहीं मानता। (2) Supervised fine-tuning (SFT): निर्देशों और अच्छे उत्तरों के चुने हुए उदाहरणों पर प्रशिक्षण ताकि मॉडल सहायक की तरह व्यवहार करे। (3) Preference tuning / alignment (RLHF, DPO और संबंधित तरीक़े): इंसान या AI judges उत्तरों की रैंकिंग करते हैं और मॉडल को सहायक, ईमानदार और हानिरहित उत्तरों की ओर धकेला जाता है। विशिष्ट विधियाँ labs के बीच अलग हैं और जल्दी बदलती हैं, पर यह समग्र ढाँचा आम है।
चरण एक नज़र में
हर चरण बदलता है कि मॉडल किसमें अच्छा है।
Stage Data Result
Pretraining web, books, code (trillions) base model: fluent, knows a lot, ignores instructions
SFT instruction/answer pairs follows instructions, chat format
Preference tuning ranked answers more helpful, safer, better tone
Deployment prompts + tools + retrieval the product users seeBase बनाम chat मॉडल
कई providers दोनों देते हैं। सहायकों के लिए chat या instruct संस्करण लें, और base तभी जब कच्चा पाठ-विस्तार चाहिए या ख़ुद tune करना हो।
त्वरित जाँच: कौन-सा चरण आम तौर पर सबसे महँगा है?
- Pretraining
- Prompt लिखना
- UI render करना
- Spell checking
Answer
Pretraining — Pretraining डेटा और मॉडल के आकार के कारण अधिकांश compute खाता है।