पाठ 24 / 27
Latency, लागत और Caching
RAG को तेज़ और किफ़ायती बनाएँ।
समय और पैसा कहाँ जाता है
Query-समय latency, query rewrite, सवाल की embedding, retrieval, reranking और generation का योग है; generation आम तौर पर हावी होता है और prompt आकार के साथ बढ़ता है। घटाने के तरीक़े: उत्तर stream करें, कम पर बेहतर chunks retrieve करें, reranking सिर्फ़ छोटी shortlist पर करें, आसान सवालों के लिए छोटा मॉडल (और बड़ा सिर्फ़ ज़रूरत पर) उपयोग करें, बार-बार आने वाली queries के embeddings और एक-जैसे सवालों के पूरे उत्तर cache करें, जहाँ समर्थित हो निश्चित निर्देश-प्रीफ़िक्स के लिए prompt caching उपयोग करें, और retrieval चरण समानांतर चलाएँ। p50/p95 latency, प्रति अनुरोध tokens और प्रति उत्तरित सवाल लागत ट्रैक करें।
प्रति उत्तरित सवाल लागत मापें
कुल मासिक लागत को अनुरोधों से नहीं, वास्तव में उत्तरित सवालों से भाग दें, ताकि refusals और retries ईमानदारी से गिने जाएँ।
त्वरित जाँच: RAG latency पर आम तौर पर कौन-सा चरण हावी होता है?
- Hash निकालना
- Page लोड करना
- LLM generation
- पाँच पंक्तियाँ sort करना
Answer
LLM generation — Tokens बनाना retrieval चरणों से ज़्यादा समय लेता है, ख़ासकर लंबे prompts के साथ।