# मॉडल आकार और Quantization — Large Language Models

Source: https://www.geekswithgeeks.com/hi/llms/d-quant

> Hardware ज़रूरतें आँकें और मॉडल छोटे करें।

## प्रति weight कम bits

मॉडल स्मृति लगभग **parameters × प्रति parameter bytes** है। **Quantization** weights को कम bits से रखती है (जैसे 16-bit की जगह 8-bit या 4-bit), जिससे स्मृति घटती है और अक्सर inference तेज़ होता है, आम तौर पर छोटी और कार्य-निर्भर गुणवत्ता हानि के साथ। इसी से 7B-parameter मॉडल laptop या साधारण GPU पर चल पाता है। आकार के अन्य उपाय: **distillation** (छोटे मॉडल को बड़े की नक़ल करना सिखाना), **mixture-of-experts** (प्रति token network का सिर्फ़ हिस्सा सक्रिय) और कार्य के लिए छोटा मॉडल चुनना। KV cache और activations के लिए स्मृति छोड़ना न भूलें।

## आकार, गति, चुनाव

Quantization, batching और open बनाम hosted का चुनाव लागत और नियंत्रण तय करते हैं।

![तीन सवाल: समाए, serve हो, चुनें।](assets/figures/llms/section-7-map.svg) — चित्र 7.1 — समाए, serve हो और चुनें।

## Precision के अनुसार weights स्मृति

मैंने यह सादा-Python (सिर्फ़ standard library) उदाहरण चलाया। 70B मॉडल के weights को fp16 में 140 GB पर 4-bit में 35 GB चाहिए; 7B मॉडल 14 GB से 3.5 GB हो जाता है। ये सिर्फ़ weights हैं, KV cache छोड़कर।

```python
for name, b in (("7B", 7), ("70B", 70)):
    for label, bytes_per in (("fp16", 2), ("int8", 1), ("4-bit", 0.5)):
        print(name, label, b * bytes_per, "GB")
```

Output:

```
7B fp16 14 GB
7B int8 7 GB
7B 4-bit 3.5 GB
70B fp16 140 GB
70B int8 70 GB
70B 4-bit 35.0 GB
```

**Quiz:** 4-bit quantization मुख्य रूप से क्या घटाती है?

- [ ] शब्दावली
- [ ] Users की संख्या
- [x] Weights द्वारा उपयोग की गई स्मृति
- [ ] प्रशिक्षण डेटा

*Answer:* Weights द्वारा उपयोग की गई स्मृति. प्रति weight कम bits का अर्थ छोटा स्मृति-पदचिह्न।
