# Parameters: max_tokens, Temperature, Top-p, Stop — Claude API / OpenAI API की बुनियाद

Source: https://www.geekswithgeeks.com/hi/llm-apis/m-params

> लंबाई, randomness और रुकना नियंत्रित करें।

## कुछ ही knobs सबसे मायने रखते हैं

**max_tokens** उत्तर की लंबाई (और इसलिए अधिकतम output लागत) सीमित करता है; मॉडल उस तक पहुँचे तो उत्तर कट जाता है और stop reason यह बताता है, इसलिए जाँचें। **temperature** randomness नियंत्रित करता है: कम मान (0 के पास) निष्कर्षण और वर्गीकरण के लिए केंद्रित, लगभग-दोहराने योग्य आउटपुट देते हैं; अधिक मान brainstorming के लिए अधिक विविध पाठ; यह कभी एक-सा या सही आउटपुट गारंटी नहीं देता। **top_p** (nucleus sampling) चुनाव सबसे संभावित tokens तक सीमित करता है; temperature या top_p में से एक बदलें, दोनों नहीं। **stop sequences** दी गई string आने पर generation रोकते हैं। कुछ नए मॉडल कुछ sampling parameters सीमित या अनदेखा करते हैं, इसलिए अपने मॉडल का दस्तावेज़ देखें।

## Parameter cheat sheet

अपने कार्य के अनुसार ढालने के लिए शुरुआती मान।

```text
Task                          temperature   max_tokens        notes
extract fields / classify     0 - 0.2       small (50-200)    validate the output in code
summarise a document          0.2 - 0.5     medium            ask for a length in the prompt too
customer reply draft          0.3 - 0.7     medium            human review for sensitive cases
brainstorm names / ideas      0.8 - 1.0     medium            expect variety, check for repetition

Always: check stop_reason / finish_reason for truncation ("max_tokens" / "length").
```

## max_tokens सोच-समझकर रखें

बहुत कम उत्तर काटता है; बहुत अधिक लंबे, महँगे उत्तर होने देता है। जो सबसे लंबा उत्तर आप वास्तव में अपेक्षित करते हैं उससे सीमा चुनें।

**Quiz:** max_tokens (या length) stop reason क्या बताता है?

- [x] उत्तर आपकी सीमा पर कट गया
- [ ] उत्तर बिल्कुल सही है
- [ ] Key अमान्य है
- [ ] मॉडल ने मना किया

*Answer:* उत्तर आपकी सीमा पर कट गया. कटा आउटपुट अधूरा या अमान्य JSON हो सकता है; इसे स्पष्ट रूप से सँभालें।
