# लागत, Latency और Prompt लंबाई — Prompt Engineering

Source: https://www.geekswithgeeks.com/hi/prompt-engineering/v-cost

> सिस्टम किफ़ायती और तेज़ रखने को prompts छोटे करें और मॉडल चुनें।

## हर token का भुगतान, हर call पर

Providers प्रति input और output token शुल्क लेते हैं, इसलिए लंबे निश्चित प्रीफ़िक्स का भुगतान **हर call** पर होता है। लागत और देरी घटाएँ: अनावश्यक निर्देश और ग़ैर-ज़रूरी उदाहरण काटकर, retrieved संदर्भ छोटा करके, **अधिकतम output tokens** सीमित करके, आसान कार्यों के लिए **छोटा मॉडल** उपयोग करके, जहाँ उपलब्ध हो दोहराए प्रीफ़िक्स **cache** (prompt caching) करके, और ग़ैर-ज़रूरी काम batch करके। Prompt छोटा करने के बाद हमेशा test set चलाकर पुष्टि करें कि गुणवत्ता बनी रही। नीचे की संख्याएँ उदाहरण क़ीमतें हैं, किसी provider की असली मूल्य-सूची नहीं।

## छोटा prompt क्या बचाता है, चलाकर

मैंने यह सादा-Python (सिर्फ़ standard library) उदाहरण चलाया। उदाहरण क़ीमतों पर prompt को 1,800 से 600 tokens करना प्रति 100,000 calls $360 बचाता है ($840 से $480)।

```python
def cost(prompt_tokens, output_tokens, price_in=3.0, price_out=15.0, calls=1):
    return calls * (prompt_tokens * price_in + output_tokens * price_out) / 1e6

long_p, short_p = 1800, 600
print("long prompt per 100k calls: $", round(cost(long_p, 200, calls=100_000), 2))
print("short prompt per 100k calls: $", round(cost(short_p, 200, calls=100_000), 2))
print("saving: $", round(cost(long_p, 200, calls=100_000) - cost(short_p, 200, calls=100_000), 2))

```

Output:

```
long prompt per 100k calls: $ 840.0
short prompt per 100k calls: $ 480.0
saving: $ 360.0
```

**Quiz:** लंबा निश्चित prompt प्रीफ़िक्स लागत के लिए क्यों मायने रखता है?

- [x] उसका भुगतान हर एक call पर होता है
- [ ] वह मुफ़्त है
- [ ] उसका भुगतान साल में एक बार होता है
- [ ] वह output tokens घटाता है

*Answer:* उसका भुगतान हर एक call पर होता है. निश्चित overhead call की मात्रा के साथ गुणा होता है।
