# Scaling Laws और डेटा — Large Language Models

Source: https://www.geekswithgeeks.com/hi/llms/r-scaling

> Parameters, डेटा और compute को मॉडल गुणवत्ता से जोड़ें।

## बड़ा मदद करता है, पर संतुलन ज़रूरी

**Scaling laws** पर शोध ने पाया कि parameters, प्रशिक्षण tokens और compute बढ़ाने पर loss सहजता और पूर्वानुमान के साथ घटता है। Chinchilla जैसे अध्ययनों ने दिखाया कि दिए compute बजट पर parameters और डेटा साथ बढ़ने चाहिए; कई पुराने मॉडल बहुत कम डेटा पर under-trained थे। **डेटा गुणवत्ता** मात्रा जितनी मायने रखती है: duplicates हटाना, निम्न-गुणवत्ता या विषैला पाठ छानना, भाषाओं और कोड का संतुलन, और test-set leakage हटाना, सब नतीजे बदलते हैं। प्रशिक्षण को हज़ारों accelerators और हफ़्तों का समय भी चाहिए, इसीलिए अधिकतर टीमें scratch से प्रशिक्षण की जगह मौजूदा मॉडल उपयोग या अनुकूलित करती हैं।

## पैमाना, डेटा, tuning

क्षमता डेटा और compute से आती है; tuning व्यवहार ढालती है।

![तीन उत्तोलक: pretrain, fine-tune, align।](assets/figures/llms/section-4-map.svg) — चित्र 4.1 — Pretrain, fine-tune और align।

## Test-set leakage जाँचें

Benchmark सवाल प्रशिक्षण डेटा में हों तो scores असली क्षमता से बेहतर दिखते हैं। अपने ताज़ा डेटा से बने मूल्यांकन को प्राथमिकता दें।

**Quiz:** Scaling-law शोध ने निश्चित compute बजट के लिए क्या सुझाया?

- [ ] दोनों मायने नहीं रखते
- [ ] सिर्फ़ parameters जोड़ें
- [ ] सिर्फ़ डेटा जोड़ें
- [x] Parameters और प्रशिक्षण डेटा साथ बढ़ाएँ

*Answer:* Parameters और प्रशिक्षण डेटा साथ बढ़ाएँ. मॉडल आकार और डेटा का संतुलित बढ़ना समान compute पर बेहतर loss देता है।
