# Serving, Batching और मॉडल का चुनाव — Large Language Models

Source: https://www.geekswithgeeks.com/hi/llms/d-serving

> Hosted APIs और self-hosted open मॉडलों की तुलना करें और throughput समझें।

## किराए पर या ख़ुद चलाएँ

**Hosted APIs** बिना infrastructure के सबसे मज़बूत मॉडल, प्रति-token मूल्य और तेज़ प्रयोग देते हैं, पर आपका डेटा provider के पास जाता है और लागत उपयोग के साथ बढ़ती है। **Open-weight मॉडल** (आपके servers या managed host पर) नियंत्रण, privacy और ऊँची मात्रा पर अनुमेय लागत देते हैं, पर GPUs, scaling और updates आप सँभालते हैं। Serving engines **continuous batching** (चलते batch में नए अनुरोध जोड़ना), **paged KV-cache** प्रबंधन और बनते ही tokens user तक **streaming** से throughput सुधारते हैं। अपने डेटा पर छोटे मूल्यांकन से तय करें: गुणवत्ता, latency, लागत, privacy और licence शर्तें। अपना कोड पतले interface के पीछे रखें ताकि बाद में मॉडल बदल सकें।

## निर्णय तालिका

शुरुआती बिंदु; अपने परीक्षणों से पुष्टि करें।

```text
Situation                                   Lean toward
Prototype, small volume, need best quality    hosted API
Sensitive data that cannot leave your network open-weight, self-hosted
Very high volume, simple repetitive task      smaller / quantized open model
Need latest knowledge or citations            any model + retrieval
Unsure                                        run an eval on 50 real examples
```

**Quiz:** Tokens streaming का एक लाभ क्या है?

- [ ] उत्तर अधिक सटीक हो जाते हैं
- [ ] मॉडल छोटा हो जाता है
- [x] Users को आउटपुट जल्दी शुरू होता दिखता है, जिससे अनुभव की latency सुधरती है
- [ ] Tokens मुफ़्त हो जाते हैं

*Answer:* Users को आउटपुट जल्दी शुरू होता दिखता है, जिससे अनुभव की latency सुधरती है. Streaming पूरे उत्तर का इंतज़ार किए बिना आंशिक आउटपुट तुरंत दिखाता है।
