पाठ 26 / 29

Agents का मूल्यांकन: Trajectories, Tools और परिणाम

सिर्फ़ अंतिम उत्तर नहीं, अपनाया गया रास्ता भी आँकें।

सही उत्तर, ग़लत तरीक़ा भी विफलता है

Agents असुरक्षित या फ़िज़ूल रास्ते से सही उत्तर तक पहुँच सकते हैं, या अच्छे रास्ते के बाद ग़लत उत्तर तक। तीन स्तरों पर आँकें: परिणाम (क्या अंतिम उत्तर या अंतिम स्थिति सही और आधारित है?), trajectory (क्या सही tools, समझदार क्रम में, सही arguments के साथ, कम चरणों में बुलाए गए?) और दक्षता व सुरक्षा (tokens, लागत, latency, निषिद्ध कार्रवाइयाँ नहीं, अनुमोदन माने गए)। अपेक्षित परिणामों और, जहाँ उपयोगी, अपेक्षित tool क्रमों के साथ वास्तविक कार्यों का dataset बनाएँ; विरोधी और अनुत्तरणीय मामले शामिल करें। विफलताएँ देखने को traces (जैसे LangSmith या कोई OpenTelemetry-संगत tool) उपयोग करें, और हर prompt, tool या मॉडल बदलाव पर suite दोबारा चलाएँ।

त्वरित जाँच: सिर्फ़ अंतिम उत्तर नहीं, trajectory क्यों आँकें?

  • Agent ग़लत या असुरक्षित कारणों से सही हो सकता है
  • Trajectories छोटी होती हैं
  • अंतिम उत्तर कभी उपयोगी नहीं होते
  • यह tracing से बचाता है
Answer

Agent ग़लत या असुरक्षित कारणों से सही हो सकता है — रास्ता बेकार चरण, ग़लत tools और नीति उल्लंघन उजागर करता है।