पाठ 20 / 25
Token Economics
Input tokens, output tokens और क़ीमतों से प्रति-अनुरोध और मासिक ख़र्च का अनुमान लगाएँ।
Input और output की क़ीमतें अलग हैं
Providers प्रति दस लाख tokens शुल्क लेते हैं, आम तौर पर input से ज़्यादा output के लिए। प्रति अनुरोध लागत = input tokens × input क़ीमत + output tokens × output क़ीमत। Budget के लिए इसे मासिक अनुरोध संख्या से गुणा करें। अक्सर सबसे बड़ा ख़र्च-कारक input का आकार (लंबी prompts, लंबा इतिहास, कई retrieved दस्तावेज़) गुणा traffic होता है, इसलिए context छाँटना provider बदलने से ज़्यादा मायने रख सकता है। क़ीमतें अक्सर बदलती हैं; अपने provider का मौजूदा price पन्ना उपयोग करें।
पैसा कहाँ जाता है और कैसे बचाएँ
ख़र्च tokens, model चुनाव और calls की संख्या पर निर्भर है। Routing, caching और trimming तीनों घटाते हैं।
मासिक अनुमान, चलाकर
मैंने यह प्रति दस लाख input और output tokens पर 3 और 15 की उदाहरण क़ीमतों से चलाया। हर 1,500 input और 300 output tokens वाले महीने के 100,000 अनुरोधों का ख़र्च 900 है।
def monthly(requests, in_tok, out_tok, p_in, p_out):
per_request = in_tok / 1e6 * p_in + out_tok / 1e6 * p_out
return round(requests * per_request, 2)
print(monthly(100_000, 1500, 300, 3.0, 15.0))
Output:
900.0
सफल काम की लागत
सस्ती calls जो विफल होकर retries या इंसानी सुधार माँगती हैं, काम करने वाली महँगी call से ज़्यादा ख़र्च कराती हैं। सिर्फ़ प्रति token नहीं, सफलतापूर्वक पूरे हुए काम की लागत ट्रैक करें।
त्वरित जाँच: Chat उत्पाद में LLM ख़र्च को आम तौर पर सबसे ज़्यादा क्या बढ़ाता है?
- UI का रंग
- कई अनुरोधों में दोहराए गए बड़े inputs
- Font का आकार
- Buttons की संख्या
Answer
कई अनुरोधों में दोहराए गए बड़े inputs — लंबी prompts और इतिहास की क़ीमत हर call पर फिर चुकानी पड़ती है।