पाठ 14 / 27

Scaling Laws और डेटा

Parameters, डेटा और compute को मॉडल गुणवत्ता से जोड़ें।

बड़ा मदद करता है, पर संतुलन ज़रूरी

Scaling laws पर शोध ने पाया कि parameters, प्रशिक्षण tokens और compute बढ़ाने पर loss सहजता और पूर्वानुमान के साथ घटता है। Chinchilla जैसे अध्ययनों ने दिखाया कि दिए compute बजट पर parameters और डेटा साथ बढ़ने चाहिए; कई पुराने मॉडल बहुत कम डेटा पर under-trained थे। डेटा गुणवत्ता मात्रा जितनी मायने रखती है: duplicates हटाना, निम्न-गुणवत्ता या विषैला पाठ छानना, भाषाओं और कोड का संतुलन, और test-set leakage हटाना, सब नतीजे बदलते हैं। प्रशिक्षण को हज़ारों accelerators और हफ़्तों का समय भी चाहिए, इसीलिए अधिकतर टीमें scratch से प्रशिक्षण की जगह मौजूदा मॉडल उपयोग या अनुकूलित करती हैं।

पैमाना, डेटा, tuning

क्षमता डेटा और compute से आती है; tuning व्यवहार ढालती है।

तीन उत्तोलक: pretrain, fine-tune, align।
चित्र 4.1 — Pretrain, fine-tune और align।

Test-set leakage जाँचें

Benchmark सवाल प्रशिक्षण डेटा में हों तो scores असली क्षमता से बेहतर दिखते हैं। अपने ताज़ा डेटा से बने मूल्यांकन को प्राथमिकता दें।

त्वरित जाँच: Scaling-law शोध ने निश्चित compute बजट के लिए क्या सुझाया?

  • दोनों मायने नहीं रखते
  • सिर्फ़ parameters जोड़ें
  • सिर्फ़ डेटा जोड़ें
  • Parameters और प्रशिक्षण डेटा साथ बढ़ाएँ
Answer

Parameters और प्रशिक्षण डेटा साथ बढ़ाएँ — मॉडल आकार और डेटा का संतुलित बढ़ना समान compute पर बेहतर loss देता है।