पाठ 19 / 25

Trajectories का मूल्यांकन

Tool calls के क्रम को अपेक्षित रास्ते से मिलाकर अंक दें।

रास्ता मायने रखता है

दो runs दोनों सही अंतिम उत्तर दे सकते हैं, फिर भी एक में 3 tool calls लगे और दूसरे में 12, या एक ने ख़तरनाक tool उपयोग किया। Trajectory मूल्यांकन tool calls दर्ज करके उन्हें अंक देता है: सही tools, समझदार क्रम में, बिना दोहराव या निषिद्ध calls के। इसे नतीजे की जाँच (क्या अंतिम परिणाम सही था?) और ख़र्च (tokens और समय) के साथ मिलाएँ।

सिर्फ़ उत्तर नहीं, यात्रा मापें

Agents सही उत्तर ग़लत रास्ते से भी पा सकते हैं, इसलिए नतीजे के साथ रास्ते का भी मूल्यांकन करें।

अंक देने की तीन चीज़ें: नतीजा, रास्ता, ख़र्च।
चित्र 6.1 — नतीजा, रास्ता और ख़र्च।

सरल trajectory score

यह जैसा दिखाया गया वैसा ही चला। अतिरिक्त search call हर आगे की स्थिति खिसका देता है, इसलिए दूसरा score 0.25 पर आ जाता है।

def tool_sequence_score(expected, actual):
    hits = sum(1 for e, a in zip(expected, actual) if e == a)
    return round(hits / max(len(expected), len(actual)), 2)

print(tool_sequence_score(["search", "read", "write"], ["search", "read", "write"]))
print(tool_sequence_score(["search", "read", "write"], ["search", "search", "read", "write"]))

Output:

1.0
0.25

ज़रूरत से ज़्यादा न बाँधें

कई मान्य रास्ते हो सकते हैं। "निषिद्ध tool उपयोग" या "8 calls से ज़्यादा" को कड़ी विफलता मानें, और एक तय क्रम माँगने की जगह सटीक क्रम को नरम संकेत मानें।

त्वरित जाँच: सिर्फ़ अंतिम उत्तर नहीं, tool-call का रास्ता भी क्यों जाँचें?

  • रास्ते हमेशा एक-जैसे होते हैं
  • यह अपने आप agents को तेज़ करता है
  • अंतिम उत्तर जाँचे नहीं जा सकते
  • सही उत्तर बेकार या असुरक्षित steps छिपा सकता है
Answer

सही उत्तर बेकार या असुरक्षित steps छिपा सकता है — Path scoring बेकार ख़र्च, दोहराए calls और जोखिम भरे कर्म पकड़ता है जिन्हें सही उत्तर ढक सकता है।