पाठ 19 / 25
Trajectories का मूल्यांकन
Tool calls के क्रम को अपेक्षित रास्ते से मिलाकर अंक दें।
रास्ता मायने रखता है
दो runs दोनों सही अंतिम उत्तर दे सकते हैं, फिर भी एक में 3 tool calls लगे और दूसरे में 12, या एक ने ख़तरनाक tool उपयोग किया। Trajectory मूल्यांकन tool calls दर्ज करके उन्हें अंक देता है: सही tools, समझदार क्रम में, बिना दोहराव या निषिद्ध calls के। इसे नतीजे की जाँच (क्या अंतिम परिणाम सही था?) और ख़र्च (tokens और समय) के साथ मिलाएँ।
सिर्फ़ उत्तर नहीं, यात्रा मापें
Agents सही उत्तर ग़लत रास्ते से भी पा सकते हैं, इसलिए नतीजे के साथ रास्ते का भी मूल्यांकन करें।
सरल trajectory score
यह जैसा दिखाया गया वैसा ही चला। अतिरिक्त search call हर आगे की स्थिति खिसका देता है, इसलिए दूसरा score 0.25 पर आ जाता है।
def tool_sequence_score(expected, actual):
hits = sum(1 for e, a in zip(expected, actual) if e == a)
return round(hits / max(len(expected), len(actual)), 2)
print(tool_sequence_score(["search", "read", "write"], ["search", "read", "write"]))
print(tool_sequence_score(["search", "read", "write"], ["search", "search", "read", "write"]))
Output:
1.0 0.25
ज़रूरत से ज़्यादा न बाँधें
कई मान्य रास्ते हो सकते हैं। "निषिद्ध tool उपयोग" या "8 calls से ज़्यादा" को कड़ी विफलता मानें, और एक तय क्रम माँगने की जगह सटीक क्रम को नरम संकेत मानें।
त्वरित जाँच: सिर्फ़ अंतिम उत्तर नहीं, tool-call का रास्ता भी क्यों जाँचें?
- रास्ते हमेशा एक-जैसे होते हैं
- यह अपने आप agents को तेज़ करता है
- अंतिम उत्तर जाँचे नहीं जा सकते
- सही उत्तर बेकार या असुरक्षित steps छिपा सकता है
Answer
सही उत्तर बेकार या असुरक्षित steps छिपा सकता है — Path scoring बेकार ख़र्च, दोहराए calls और जोखिम भरे कर्म पकड़ता है जिन्हें सही उत्तर ढक सकता है।