# Token Economics — AI Safety, Evaluation और Cost Control

Source: https://www.geekswithgeeks.com/hi/ai-safety/cost-token-economics

> Input tokens, output tokens और क़ीमतों से प्रति-अनुरोध और मासिक ख़र्च का अनुमान लगाएँ।

## Input और output की क़ीमतें अलग हैं

Providers प्रति दस लाख tokens शुल्क लेते हैं, आम तौर पर **input से ज़्यादा output के लिए**। प्रति अनुरोध लागत = input tokens × input क़ीमत + output tokens × output क़ीमत। Budget के लिए इसे मासिक अनुरोध संख्या से गुणा करें। अक्सर सबसे बड़ा ख़र्च-कारक **input का आकार** (लंबी prompts, लंबा इतिहास, कई retrieved दस्तावेज़) गुणा traffic होता है, इसलिए context छाँटना provider बदलने से ज़्यादा मायने रख सकता है। क़ीमतें अक्सर बदलती हैं; अपने provider का मौजूदा price पन्ना उपयोग करें।

## पैसा कहाँ जाता है और कैसे बचाएँ

ख़र्च tokens, model चुनाव और calls की संख्या पर निर्भर है। Routing, caching और trimming तीनों घटाते हैं।

![चार लीवर: route, cache, trim, cap।](assets/figures/ai-safety/section-7-map.svg) — चित्र 7.1 — Route, cache, trim और cap।

## मासिक अनुमान, चलाकर

मैंने यह प्रति दस लाख input और output tokens पर 3 और 15 की उदाहरण क़ीमतों से चलाया। हर 1,500 input और 300 output tokens वाले महीने के 100,000 अनुरोधों का ख़र्च 900 है।

```python
def monthly(requests, in_tok, out_tok, p_in, p_out):
    per_request = in_tok / 1e6 * p_in + out_tok / 1e6 * p_out
    return round(requests * per_request, 2)

print(monthly(100_000, 1500, 300, 3.0, 15.0))
```

Output:

```
900.0
```

## सफल काम की लागत

सस्ती calls जो विफल होकर retries या इंसानी सुधार माँगती हैं, काम करने वाली महँगी call से ज़्यादा ख़र्च कराती हैं। सिर्फ़ प्रति token नहीं, सफलतापूर्वक पूरे हुए काम की लागत ट्रैक करें।

**Quiz:** Chat उत्पाद में LLM ख़र्च को आम तौर पर सबसे ज़्यादा क्या बढ़ाता है?

- [ ] UI का रंग
- [x] कई अनुरोधों में दोहराए गए बड़े inputs
- [ ] Font का आकार
- [ ] Buttons की संख्या

*Answer:* कई अनुरोधों में दोहराए गए बड़े inputs. लंबी prompts और इतिहास की क़ीमत हर call पर फिर चुकानी पड़ती है।
