पाठ 26 / 29
Agents का मूल्यांकन: Trajectories, Tools और परिणाम
सिर्फ़ अंतिम उत्तर नहीं, अपनाया गया रास्ता भी आँकें।
सही उत्तर, ग़लत तरीक़ा भी विफलता है
Agents असुरक्षित या फ़िज़ूल रास्ते से सही उत्तर तक पहुँच सकते हैं, या अच्छे रास्ते के बाद ग़लत उत्तर तक। तीन स्तरों पर आँकें: परिणाम (क्या अंतिम उत्तर या अंतिम स्थिति सही और आधारित है?), trajectory (क्या सही tools, समझदार क्रम में, सही arguments के साथ, कम चरणों में बुलाए गए?) और दक्षता व सुरक्षा (tokens, लागत, latency, निषिद्ध कार्रवाइयाँ नहीं, अनुमोदन माने गए)। अपेक्षित परिणामों और, जहाँ उपयोगी, अपेक्षित tool क्रमों के साथ वास्तविक कार्यों का dataset बनाएँ; विरोधी और अनुत्तरणीय मामले शामिल करें। विफलताएँ देखने को traces (जैसे LangSmith या कोई OpenTelemetry-संगत tool) उपयोग करें, और हर prompt, tool या मॉडल बदलाव पर suite दोबारा चलाएँ।
त्वरित जाँच: सिर्फ़ अंतिम उत्तर नहीं, trajectory क्यों आँकें?
- Agent ग़लत या असुरक्षित कारणों से सही हो सकता है
- Trajectories छोटी होती हैं
- अंतिम उत्तर कभी उपयोगी नहीं होते
- यह tracing से बचाता है
Answer
Agent ग़लत या असुरक्षित कारणों से सही हो सकता है — रास्ता बेकार चरण, ग़लत tools और नीति उल्लंघन उजागर करता है।