पाठ 23 / 25
Cost और Latency
Caching, छोटे models और घटाए गए context से ख़र्च और प्रतीक्षा घटाएँ।
Tokens कहाँ जाते हैं
ख़र्च अंदर-बाहर जाने वाले tokens और model calls की संख्या के साथ बढ़ता है। इसे घटाएँ: कम context भेजकर, दोहराए जाने वाले हिस्सों को prompt caching से cache करके, आसान steps के लिए छोटा model उपयोग करके, और प्रतीक्षा घटाने के लिए स्वतंत्र calls parallel चलाकर। पहले मापें ताकि वही step सुधारें जो सचमुच हावी है।
काटने से पहले गिनें
हर step के tokens और समय log करें। अक्सर एक वाचाल tool result या एक बड़ी file अधिकांश बिल बनाती है, और वही एक चीज़ छाँटना किसी भी चतुर prompt से ज़्यादा बचाता है।
त्वरित जाँच: Agent का ख़र्च घटाने से पहले क्या करना चाहिए?
- अंदाज़ा लगाएँ कि कौन-सा step महँगा है
- हर step के tokens और समय मापें
- सारे tools हटाएँ
- तुरंत provider बदलें
Answer
हर step के tokens और समय मापें — माप दिखाते हैं कि ख़र्च असल में कहाँ है, ताकि मेहनत सही जगह लगे।