पाठ 25 / 27

Serving, Batching और मॉडल का चुनाव

Hosted APIs और self-hosted open मॉडलों की तुलना करें और throughput समझें।

किराए पर या ख़ुद चलाएँ

Hosted APIs बिना infrastructure के सबसे मज़बूत मॉडल, प्रति-token मूल्य और तेज़ प्रयोग देते हैं, पर आपका डेटा provider के पास जाता है और लागत उपयोग के साथ बढ़ती है। Open-weight मॉडल (आपके servers या managed host पर) नियंत्रण, privacy और ऊँची मात्रा पर अनुमेय लागत देते हैं, पर GPUs, scaling और updates आप सँभालते हैं। Serving engines continuous batching (चलते batch में नए अनुरोध जोड़ना), paged KV-cache प्रबंधन और बनते ही tokens user तक streaming से throughput सुधारते हैं। अपने डेटा पर छोटे मूल्यांकन से तय करें: गुणवत्ता, latency, लागत, privacy और licence शर्तें। अपना कोड पतले interface के पीछे रखें ताकि बाद में मॉडल बदल सकें।

निर्णय तालिका

शुरुआती बिंदु; अपने परीक्षणों से पुष्टि करें।

Situation                                   Lean toward
Prototype, small volume, need best quality    hosted API
Sensitive data that cannot leave your network open-weight, self-hosted
Very high volume, simple repetitive task      smaller / quantized open model
Need latest knowledge or citations            any model + retrieval
Unsure                                        run an eval on 50 real examples

त्वरित जाँच: Tokens streaming का एक लाभ क्या है?

  • उत्तर अधिक सटीक हो जाते हैं
  • मॉडल छोटा हो जाता है
  • Users को आउटपुट जल्दी शुरू होता दिखता है, जिससे अनुभव की latency सुधरती है
  • Tokens मुफ़्त हो जाते हैं
Answer

Users को आउटपुट जल्दी शुरू होता दिखता है, जिससे अनुभव की latency सुधरती है — Streaming पूरे उत्तर का इंतज़ार किए बिना आंशिक आउटपुट तुरंत दिखाता है।