पाठ 20 / 25

Token Economics

Input tokens, output tokens और क़ीमतों से प्रति-अनुरोध और मासिक ख़र्च का अनुमान लगाएँ।

Input और output की क़ीमतें अलग हैं

Providers प्रति दस लाख tokens शुल्क लेते हैं, आम तौर पर input से ज़्यादा output के लिए। प्रति अनुरोध लागत = input tokens × input क़ीमत + output tokens × output क़ीमत। Budget के लिए इसे मासिक अनुरोध संख्या से गुणा करें। अक्सर सबसे बड़ा ख़र्च-कारक input का आकार (लंबी prompts, लंबा इतिहास, कई retrieved दस्तावेज़) गुणा traffic होता है, इसलिए context छाँटना provider बदलने से ज़्यादा मायने रख सकता है। क़ीमतें अक्सर बदलती हैं; अपने provider का मौजूदा price पन्ना उपयोग करें।

पैसा कहाँ जाता है और कैसे बचाएँ

ख़र्च tokens, model चुनाव और calls की संख्या पर निर्भर है। Routing, caching और trimming तीनों घटाते हैं।

चार लीवर: route, cache, trim, cap।
चित्र 7.1 — Route, cache, trim और cap।

मासिक अनुमान, चलाकर

मैंने यह प्रति दस लाख input और output tokens पर 3 और 15 की उदाहरण क़ीमतों से चलाया। हर 1,500 input और 300 output tokens वाले महीने के 100,000 अनुरोधों का ख़र्च 900 है।

def monthly(requests, in_tok, out_tok, p_in, p_out):
    per_request = in_tok / 1e6 * p_in + out_tok / 1e6 * p_out
    return round(requests * per_request, 2)

print(monthly(100_000, 1500, 300, 3.0, 15.0))

Output:

900.0

सफल काम की लागत

सस्ती calls जो विफल होकर retries या इंसानी सुधार माँगती हैं, काम करने वाली महँगी call से ज़्यादा ख़र्च कराती हैं। सिर्फ़ प्रति token नहीं, सफलतापूर्वक पूरे हुए काम की लागत ट्रैक करें।

त्वरित जाँच: Chat उत्पाद में LLM ख़र्च को आम तौर पर सबसे ज़्यादा क्या बढ़ाता है?

  • UI का रंग
  • कई अनुरोधों में दोहराए गए बड़े inputs
  • Font का आकार
  • Buttons की संख्या
Answer

कई अनुरोधों में दोहराए गए बड़े inputs — लंबी prompts और इतिहास की क़ीमत हर call पर फिर चुकानी पड़ती है।