पाठ 23 / 25

Cost और Latency

Caching, छोटे models और घटाए गए context से ख़र्च और प्रतीक्षा घटाएँ।

Tokens कहाँ जाते हैं

ख़र्च अंदर-बाहर जाने वाले tokens और model calls की संख्या के साथ बढ़ता है। इसे घटाएँ: कम context भेजकर, दोहराए जाने वाले हिस्सों को prompt caching से cache करके, आसान steps के लिए छोटा model उपयोग करके, और प्रतीक्षा घटाने के लिए स्वतंत्र calls parallel चलाकर। पहले मापें ताकि वही step सुधारें जो सचमुच हावी है।

काटने से पहले गिनें

हर step के tokens और समय log करें। अक्सर एक वाचाल tool result या एक बड़ी file अधिकांश बिल बनाती है, और वही एक चीज़ छाँटना किसी भी चतुर prompt से ज़्यादा बचाता है।

त्वरित जाँच: Agent का ख़र्च घटाने से पहले क्या करना चाहिए?

  • अंदाज़ा लगाएँ कि कौन-सा step महँगा है
  • हर step के tokens और समय मापें
  • सारे tools हटाएँ
  • तुरंत provider बदलें
Answer

हर step के tokens और समय मापें — माप दिखाते हैं कि ख़र्च असल में कहाँ है, ताकि मेहनत सही जगह लगे।