पाठ 11 / 25
max_tokens समझदारी से सेट करना
काम के अनुरूप output सीमा चुनें और कटाव सँभालें।
`max_tokens` सीमा है, लक्ष्य नहीं
max_tokens वह अधिकतम है जो model एक reply में बना सकता है। इससे model उतना लिखता नहीं। बहुत कम हो तो उत्तर या tool calls कट जाते हैं; बहुत ज़्यादा हो तो आपका reserve बर्बाद होता है और बेक़ाबू output की गुंजाइश बनती है। अपेक्षित उत्तर के अनुसार मान चुनें (छोटे tool call को लंबी रिपोर्ट से बहुत कम चाहिए)।
अलग बारियों के लिए अलग सीमा
जब agent tools से काम कर रहा हो तो छोटी सीमा और अंतिम लेख के लिए बड़ी सीमा उपयोग करें।
ACTING_CAP = 1_024 # tool calls and short thoughts
FINAL_CAP = 4_096 # final summary
reply = client.messages.create(
model=MODEL, max_tokens=ACTING_CAP, tools=TOOLS, messages=messages)त्वरित जाँच: max_tokens बढ़ाने से क्या होता है?
- Model को उतने tokens लिखने पर मजबूर करता है
- लंबे replies की अनुमति देता है पर मजबूर नहीं करता
- Model को तेज़ बनाता है
- Context window बढ़ाता है
Answer
लंबे replies की अनुमति देता है पर मजबूर नहीं करता — यह reply की लंबाई की ऊपरी सीमा बढ़ाता है; model काम पूरा होते ही फिर भी रुकता है।