# Latency, लागत और Caching — Retrieval-Augmented Generation (RAG)

Source: https://www.geekswithgeeks.com/hi/rag/p-perf

> RAG को तेज़ और किफ़ायती बनाएँ।

## समय और पैसा कहाँ जाता है

Query-समय latency, query rewrite, सवाल की embedding, retrieval, reranking और generation का योग है; generation आम तौर पर हावी होता है और prompt आकार के साथ बढ़ता है। घटाने के तरीक़े: उत्तर **stream** करें, कम पर बेहतर chunks retrieve करें, reranking सिर्फ़ छोटी shortlist पर करें, आसान सवालों के लिए **छोटा मॉडल** (और बड़ा सिर्फ़ ज़रूरत पर) उपयोग करें, बार-बार आने वाली queries के embeddings और एक-जैसे सवालों के पूरे उत्तर **cache** करें, जहाँ समर्थित हो निश्चित निर्देश-प्रीफ़िक्स के लिए **prompt caching** उपयोग करें, और retrieval चरण **समानांतर** चलाएँ। p50/p95 latency, प्रति अनुरोध tokens और प्रति उत्तरित सवाल लागत ट्रैक करें।

## प्रति उत्तरित सवाल लागत मापें

कुल मासिक लागत को अनुरोधों से नहीं, वास्तव में उत्तरित सवालों से भाग दें, ताकि refusals और retries ईमानदारी से गिने जाएँ।

**Quiz:** RAG latency पर आम तौर पर कौन-सा चरण हावी होता है?

- [ ] Hash निकालना
- [ ] Page लोड करना
- [x] LLM generation
- [ ] पाँच पंक्तियाँ sort करना

*Answer:* LLM generation. Tokens बनाना retrieval चरणों से ज़्यादा समय लेता है, ख़ासकर लंबे prompts के साथ।
