पाठ 20 / 27

लागत, Latency और Caching

Tokens से API लागत आँकें और घटाएँ।

आप प्रति token भुगतान करते हैं

Hosted APIs प्रति दस लाख input tokens और प्रति दस लाख output tokens शुल्क लेते हैं, आम तौर पर output महँगा। Latency के दो हिस्से हैं: पहले token का समय (prompt पढ़ना) और generation गति (tokens प्रति सेकंड), और लंबे outputs ज़्यादा समय लेते हैं। लागत और देरी घटाने को: prompts छोटे करें, सिर्फ़ प्रासंगिक chunks लाएँ, output लंबाई सीमित करें, आसान कार्यों में छोटा मॉडल उपयोग करें, जहाँ provider समर्थन दे वहाँ दोहराए prompt प्रीफ़िक्स cache करें, और ग़ैर-ज़रूरी काम batch करें। नीचे की क़ीमतें उदाहरण संख्याएँ हैं, किसी provider की असली मूल्य-सूची नहीं।

मासिक लागत अनुमान, चलाकर

मैंने यह सादा-Python (सिर्फ़ standard library) उदाहरण चलाया। उदाहरण क़ीमतों पर 2,000-token prompt और 500-token उत्तर वाली दस हज़ार calls की लागत $135 है; prompt को उसकी क़ीमत के 10% पर cache करने से यह $81 हो जाती।

price_in, price_out = 3.0, 15.0     # example prices, USD per million tokens
prompt_tokens, output_tokens, calls = 2000, 500, 10000
cost = calls * (prompt_tokens * price_in + output_tokens * price_out) / 1e6
print("monthly cost: $", cost)
cached = calls * (prompt_tokens * price_in * 0.1 + output_tokens * price_out) / 1e6
print("if the 2000-token prompt were cached at 10% price: $", cached)

Output:

monthly cost: $ 135.0
if the 2000-token prompt were cached at 10% price: $ 81.0

त्वरित जाँच: आसान वर्गीकरण कार्यों में कौन-सा बदलाव आम तौर पर लागत सबसे ज़्यादा घटाता है?

  • लंबे prompt के साथ सबसे बड़ा मॉडल
  • छोटे prompt के साथ छोटा मॉडल उपयोग करना
  • Temperature बढ़ाना
  • हर call में और उदाहरण जोड़ना
Answer

छोटे prompt के साथ छोटा मॉडल उपयोग करना — मॉडल आकार और prompt लंबाई कार्य की कठिनाई से मिलाएँ।