पाठ 26 / 29
लागत, Latency और Prompt लंबाई
सिस्टम किफ़ायती और तेज़ रखने को prompts छोटे करें और मॉडल चुनें।
हर token का भुगतान, हर call पर
Providers प्रति input और output token शुल्क लेते हैं, इसलिए लंबे निश्चित प्रीफ़िक्स का भुगतान हर call पर होता है। लागत और देरी घटाएँ: अनावश्यक निर्देश और ग़ैर-ज़रूरी उदाहरण काटकर, retrieved संदर्भ छोटा करके, अधिकतम output tokens सीमित करके, आसान कार्यों के लिए छोटा मॉडल उपयोग करके, जहाँ उपलब्ध हो दोहराए प्रीफ़िक्स cache (prompt caching) करके, और ग़ैर-ज़रूरी काम batch करके। Prompt छोटा करने के बाद हमेशा test set चलाकर पुष्टि करें कि गुणवत्ता बनी रही। नीचे की संख्याएँ उदाहरण क़ीमतें हैं, किसी provider की असली मूल्य-सूची नहीं।
छोटा prompt क्या बचाता है, चलाकर
मैंने यह सादा-Python (सिर्फ़ standard library) उदाहरण चलाया। उदाहरण क़ीमतों पर prompt को 1,800 से 600 tokens करना प्रति 100,000 calls $360 बचाता है ($840 से $480)।
def cost(prompt_tokens, output_tokens, price_in=3.0, price_out=15.0, calls=1):
return calls * (prompt_tokens * price_in + output_tokens * price_out) / 1e6
long_p, short_p = 1800, 600
print("long prompt per 100k calls: $", round(cost(long_p, 200, calls=100_000), 2))
print("short prompt per 100k calls: $", round(cost(short_p, 200, calls=100_000), 2))
print("saving: $", round(cost(long_p, 200, calls=100_000) - cost(short_p, 200, calls=100_000), 2))
Output:
long prompt per 100k calls: $ 840.0 short prompt per 100k calls: $ 480.0 saving: $ 360.0
त्वरित जाँच: लंबा निश्चित prompt प्रीफ़िक्स लागत के लिए क्यों मायने रखता है?
- उसका भुगतान हर एक call पर होता है
- वह मुफ़्त है
- उसका भुगतान साल में एक बार होता है
- वह output tokens घटाता है
Answer
उसका भुगतान हर एक call पर होता है — निश्चित overhead call की मात्रा के साथ गुणा होता है।