पाठ 7 / 27

Parameters: max_tokens, Temperature, Top-p, Stop

लंबाई, randomness और रुकना नियंत्रित करें।

कुछ ही knobs सबसे मायने रखते हैं

max_tokens उत्तर की लंबाई (और इसलिए अधिकतम output लागत) सीमित करता है; मॉडल उस तक पहुँचे तो उत्तर कट जाता है और stop reason यह बताता है, इसलिए जाँचें। temperature randomness नियंत्रित करता है: कम मान (0 के पास) निष्कर्षण और वर्गीकरण के लिए केंद्रित, लगभग-दोहराने योग्य आउटपुट देते हैं; अधिक मान brainstorming के लिए अधिक विविध पाठ; यह कभी एक-सा या सही आउटपुट गारंटी नहीं देता। top_p (nucleus sampling) चुनाव सबसे संभावित tokens तक सीमित करता है; temperature या top_p में से एक बदलें, दोनों नहीं। stop sequences दी गई string आने पर generation रोकते हैं। कुछ नए मॉडल कुछ sampling parameters सीमित या अनदेखा करते हैं, इसलिए अपने मॉडल का दस्तावेज़ देखें।

Parameter cheat sheet

अपने कार्य के अनुसार ढालने के लिए शुरुआती मान।

Task                          temperature   max_tokens        notes
extract fields / classify     0 - 0.2       small (50-200)    validate the output in code
summarise a document          0.2 - 0.5     medium            ask for a length in the prompt too
customer reply draft          0.3 - 0.7     medium            human review for sensitive cases
brainstorm names / ideas      0.8 - 1.0     medium            expect variety, check for repetition

Always: check stop_reason / finish_reason for truncation ("max_tokens" / "length").

max_tokens सोच-समझकर रखें

बहुत कम उत्तर काटता है; बहुत अधिक लंबे, महँगे उत्तर होने देता है। जो सबसे लंबा उत्तर आप वास्तव में अपेक्षित करते हैं उससे सीमा चुनें।

त्वरित जाँच: max_tokens (या length) stop reason क्या बताता है?

  • उत्तर आपकी सीमा पर कट गया
  • उत्तर बिल्कुल सही है
  • Key अमान्य है
  • मॉडल ने मना किया
Answer

उत्तर आपकी सीमा पर कट गया — कटा आउटपुट अधूरा या अमान्य JSON हो सकता है; इसे स्पष्ट रूप से सँभालें।