# Cost और Latency — एडवांस्ड Agent Workflows और Skills

Source: https://www.geekswithgeeks.com/hi/agent-workflows/rel-cost-latency

> Caching, छोटे models और घटाए गए context से ख़र्च और प्रतीक्षा घटाएँ।

## Tokens कहाँ जाते हैं

ख़र्च अंदर-बाहर जाने वाले tokens और model calls की संख्या के साथ बढ़ता है। इसे घटाएँ: कम context भेजकर, दोहराए जाने वाले हिस्सों को **prompt caching** से cache करके, आसान steps के लिए छोटा model उपयोग करके, और प्रतीक्षा घटाने के लिए स्वतंत्र calls parallel चलाकर। पहले मापें ताकि वही step सुधारें जो सचमुच हावी है।

## काटने से पहले गिनें

हर step के tokens और समय log करें। अक्सर एक वाचाल tool result या एक बड़ी file अधिकांश बिल बनाती है, और वही एक चीज़ छाँटना किसी भी चतुर prompt से ज़्यादा बचाता है।

**Quiz:** Agent का ख़र्च घटाने से पहले क्या करना चाहिए?

- [ ] अंदाज़ा लगाएँ कि कौन-सा step महँगा है
- [x] हर step के tokens और समय मापें
- [ ] सारे tools हटाएँ
- [ ] तुरंत provider बदलें

*Answer:* हर step के tokens और समय मापें. माप दिखाते हैं कि ख़र्च असल में कहाँ है, ताकि मेहनत सही जगह लगे।
