# लागत, Latency और Caching — Large Language Models

Source: https://www.geekswithgeeks.com/hi/llms/u-cost

> Tokens से API लागत आँकें और घटाएँ।

## आप प्रति token भुगतान करते हैं

Hosted APIs प्रति दस लाख **input tokens** और प्रति दस लाख **output tokens** शुल्क लेते हैं, आम तौर पर output महँगा। Latency के दो हिस्से हैं: **पहले token का समय** (prompt पढ़ना) और **generation गति** (tokens प्रति सेकंड), और लंबे outputs ज़्यादा समय लेते हैं। लागत और देरी घटाने को: prompts छोटे करें, सिर्फ़ प्रासंगिक chunks लाएँ, output लंबाई सीमित करें, आसान कार्यों में **छोटा मॉडल** उपयोग करें, जहाँ provider समर्थन दे वहाँ दोहराए prompt प्रीफ़िक्स **cache** करें, और ग़ैर-ज़रूरी काम **batch** करें। नीचे की क़ीमतें उदाहरण संख्याएँ हैं, किसी provider की असली मूल्य-सूची नहीं।

## मासिक लागत अनुमान, चलाकर

मैंने यह सादा-Python (सिर्फ़ standard library) उदाहरण चलाया। उदाहरण क़ीमतों पर 2,000-token prompt और 500-token उत्तर वाली दस हज़ार calls की लागत $135 है; prompt को उसकी क़ीमत के 10% पर cache करने से यह $81 हो जाती।

```python
price_in, price_out = 3.0, 15.0     # example prices, USD per million tokens
prompt_tokens, output_tokens, calls = 2000, 500, 10000
cost = calls * (prompt_tokens * price_in + output_tokens * price_out) / 1e6
print("monthly cost: $", cost)
cached = calls * (prompt_tokens * price_in * 0.1 + output_tokens * price_out) / 1e6
print("if the 2000-token prompt were cached at 10% price: $", cached)

```

Output:

```
monthly cost: $ 135.0
if the 2000-token prompt were cached at 10% price: $ 81.0
```

**Quiz:** आसान वर्गीकरण कार्यों में कौन-सा बदलाव आम तौर पर लागत सबसे ज़्यादा घटाता है?

- [ ] लंबे prompt के साथ सबसे बड़ा मॉडल
- [x] छोटे prompt के साथ छोटा मॉडल उपयोग करना
- [ ] Temperature बढ़ाना
- [ ] हर call में और उदाहरण जोड़ना

*Answer:* छोटे prompt के साथ छोटा मॉडल उपयोग करना. मॉडल आकार और prompt लंबाई कार्य की कठिनाई से मिलाएँ।
