पाठ 25 / 27
Serving, Batching और मॉडल का चुनाव
Hosted APIs और self-hosted open मॉडलों की तुलना करें और throughput समझें।
किराए पर या ख़ुद चलाएँ
Hosted APIs बिना infrastructure के सबसे मज़बूत मॉडल, प्रति-token मूल्य और तेज़ प्रयोग देते हैं, पर आपका डेटा provider के पास जाता है और लागत उपयोग के साथ बढ़ती है। Open-weight मॉडल (आपके servers या managed host पर) नियंत्रण, privacy और ऊँची मात्रा पर अनुमेय लागत देते हैं, पर GPUs, scaling और updates आप सँभालते हैं। Serving engines continuous batching (चलते batch में नए अनुरोध जोड़ना), paged KV-cache प्रबंधन और बनते ही tokens user तक streaming से throughput सुधारते हैं। अपने डेटा पर छोटे मूल्यांकन से तय करें: गुणवत्ता, latency, लागत, privacy और licence शर्तें। अपना कोड पतले interface के पीछे रखें ताकि बाद में मॉडल बदल सकें।
निर्णय तालिका
शुरुआती बिंदु; अपने परीक्षणों से पुष्टि करें।
Situation Lean toward
Prototype, small volume, need best quality hosted API
Sensitive data that cannot leave your network open-weight, self-hosted
Very high volume, simple repetitive task smaller / quantized open model
Need latest knowledge or citations any model + retrieval
Unsure run an eval on 50 real examplesत्वरित जाँच: Tokens streaming का एक लाभ क्या है?
- उत्तर अधिक सटीक हो जाते हैं
- मॉडल छोटा हो जाता है
- Users को आउटपुट जल्दी शुरू होता दिखता है, जिससे अनुभव की latency सुधरती है
- Tokens मुफ़्त हो जाते हैं
Answer
Users को आउटपुट जल्दी शुरू होता दिखता है, जिससे अनुभव की latency सुधरती है — Streaming पूरे उत्तर का इंतज़ार किए बिना आंशिक आउटपुट तुरंत दिखाता है।