पाठ 26 / 29

लागत, Latency और Prompt लंबाई

सिस्टम किफ़ायती और तेज़ रखने को prompts छोटे करें और मॉडल चुनें।

हर token का भुगतान, हर call पर

Providers प्रति input और output token शुल्क लेते हैं, इसलिए लंबे निश्चित प्रीफ़िक्स का भुगतान हर call पर होता है। लागत और देरी घटाएँ: अनावश्यक निर्देश और ग़ैर-ज़रूरी उदाहरण काटकर, retrieved संदर्भ छोटा करके, अधिकतम output tokens सीमित करके, आसान कार्यों के लिए छोटा मॉडल उपयोग करके, जहाँ उपलब्ध हो दोहराए प्रीफ़िक्स cache (prompt caching) करके, और ग़ैर-ज़रूरी काम batch करके। Prompt छोटा करने के बाद हमेशा test set चलाकर पुष्टि करें कि गुणवत्ता बनी रही। नीचे की संख्याएँ उदाहरण क़ीमतें हैं, किसी provider की असली मूल्य-सूची नहीं।

छोटा prompt क्या बचाता है, चलाकर

मैंने यह सादा-Python (सिर्फ़ standard library) उदाहरण चलाया। उदाहरण क़ीमतों पर prompt को 1,800 से 600 tokens करना प्रति 100,000 calls $360 बचाता है ($840 से $480)।

def cost(prompt_tokens, output_tokens, price_in=3.0, price_out=15.0, calls=1):
    return calls * (prompt_tokens * price_in + output_tokens * price_out) / 1e6

long_p, short_p = 1800, 600
print("long prompt per 100k calls: $", round(cost(long_p, 200, calls=100_000), 2))
print("short prompt per 100k calls: $", round(cost(short_p, 200, calls=100_000), 2))
print("saving: $", round(cost(long_p, 200, calls=100_000) - cost(short_p, 200, calls=100_000), 2))

Output:

long prompt per 100k calls: $ 840.0
short prompt per 100k calls: $ 480.0
saving: $ 360.0

त्वरित जाँच: लंबा निश्चित prompt प्रीफ़िक्स लागत के लिए क्यों मायने रखता है?

  • उसका भुगतान हर एक call पर होता है
  • वह मुफ़्त है
  • उसका भुगतान साल में एक बार होता है
  • वह output tokens घटाता है
Answer

उसका भुगतान हर एक call पर होता है — निश्चित overhead call की मात्रा के साथ गुणा होता है।