पाठ 2 / 27

मॉडल का जीवन: Pretraining से Chat तक

Pretraining, instruction tuning और alignment का क्रम समझें।

तीन व्यापक चरण

(1) Pretraining: मॉडल खरबों tokens का पाठ पढ़कर अगला token अनुमानित करना सीखता है; यह सबसे महँगा चरण है और base model देता है जो पाठ आगे बढ़ाता है पर निर्देश अच्छी तरह नहीं मानता। (2) Supervised fine-tuning (SFT): निर्देशों और अच्छे उत्तरों के चुने हुए उदाहरणों पर प्रशिक्षण ताकि मॉडल सहायक की तरह व्यवहार करे। (3) Preference tuning / alignment (RLHF, DPO और संबंधित तरीक़े): इंसान या AI judges उत्तरों की रैंकिंग करते हैं और मॉडल को सहायक, ईमानदार और हानिरहित उत्तरों की ओर धकेला जाता है। विशिष्ट विधियाँ labs के बीच अलग हैं और जल्दी बदलती हैं, पर यह समग्र ढाँचा आम है।

चरण एक नज़र में

हर चरण बदलता है कि मॉडल किसमें अच्छा है।

Stage              Data                         Result
Pretraining        web, books, code (trillions)  base model: fluent, knows a lot, ignores instructions
SFT                instruction/answer pairs      follows instructions, chat format
Preference tuning  ranked answers                more helpful, safer, better tone
Deployment         prompts + tools + retrieval   the product users see

Base बनाम chat मॉडल

कई providers दोनों देते हैं। सहायकों के लिए chat या instruct संस्करण लें, और base तभी जब कच्चा पाठ-विस्तार चाहिए या ख़ुद tune करना हो।

त्वरित जाँच: कौन-सा चरण आम तौर पर सबसे महँगा है?

  • Pretraining
  • Prompt लिखना
  • UI render करना
  • Spell checking
Answer

Pretraining — Pretraining डेटा और मॉडल के आकार के कारण अधिकांश compute खाता है।