पाठ 24 / 27
मॉडल आकार और Quantization
Hardware ज़रूरतें आँकें और मॉडल छोटे करें।
प्रति weight कम bits
मॉडल स्मृति लगभग parameters × प्रति parameter bytes है। Quantization weights को कम bits से रखती है (जैसे 16-bit की जगह 8-bit या 4-bit), जिससे स्मृति घटती है और अक्सर inference तेज़ होता है, आम तौर पर छोटी और कार्य-निर्भर गुणवत्ता हानि के साथ। इसी से 7B-parameter मॉडल laptop या साधारण GPU पर चल पाता है। आकार के अन्य उपाय: distillation (छोटे मॉडल को बड़े की नक़ल करना सिखाना), mixture-of-experts (प्रति token network का सिर्फ़ हिस्सा सक्रिय) और कार्य के लिए छोटा मॉडल चुनना। KV cache और activations के लिए स्मृति छोड़ना न भूलें।
आकार, गति, चुनाव
Quantization, batching और open बनाम hosted का चुनाव लागत और नियंत्रण तय करते हैं।
Precision के अनुसार weights स्मृति
मैंने यह सादा-Python (सिर्फ़ standard library) उदाहरण चलाया। 70B मॉडल के weights को fp16 में 140 GB पर 4-bit में 35 GB चाहिए; 7B मॉडल 14 GB से 3.5 GB हो जाता है। ये सिर्फ़ weights हैं, KV cache छोड़कर।
for name, b in (("7B", 7), ("70B", 70)):
for label, bytes_per in (("fp16", 2), ("int8", 1), ("4-bit", 0.5)):
print(name, label, b * bytes_per, "GB")
Output:
7B fp16 14 GB 7B int8 7 GB 7B 4-bit 3.5 GB 70B fp16 140 GB 70B int8 70 GB 70B 4-bit 35.0 GB
त्वरित जाँच: 4-bit quantization मुख्य रूप से क्या घटाती है?
- शब्दावली
- Users की संख्या
- Weights द्वारा उपयोग की गई स्मृति
- प्रशिक्षण डेटा
Answer
Weights द्वारा उपयोग की गई स्मृति — प्रति weight कम bits का अर्थ छोटा स्मृति-पदचिह्न।