# Trajectories का मूल्यांकन — AI Agents और Tool Use

Source: https://www.geekswithgeeks.com/hi/ai-agents-mcp/eval-trajectories

> Tool calls के क्रम को अपेक्षित रास्ते से मिलाकर अंक दें।

## रास्ता मायने रखता है

दो runs दोनों सही अंतिम उत्तर दे सकते हैं, फिर भी एक में 3 tool calls लगे और दूसरे में 12, या एक ने ख़तरनाक tool उपयोग किया। **Trajectory मूल्यांकन** tool calls दर्ज करके उन्हें अंक देता है: सही tools, समझदार क्रम में, बिना दोहराव या निषिद्ध calls के। इसे नतीजे की जाँच (क्या अंतिम परिणाम सही था?) और ख़र्च (tokens और समय) के साथ मिलाएँ।

## सिर्फ़ उत्तर नहीं, यात्रा मापें

Agents सही उत्तर ग़लत रास्ते से भी पा सकते हैं, इसलिए नतीजे के साथ रास्ते का भी मूल्यांकन करें।

![अंक देने की तीन चीज़ें: नतीजा, रास्ता, ख़र्च।](assets/figures/ai-agents-mcp/section-6-map.svg) — चित्र 6.1 — नतीजा, रास्ता और ख़र्च।

## सरल trajectory score

यह जैसा दिखाया गया वैसा ही चला। अतिरिक्त `search` call हर आगे की स्थिति खिसका देता है, इसलिए दूसरा score 0.25 पर आ जाता है।

```python
def tool_sequence_score(expected, actual):
    hits = sum(1 for e, a in zip(expected, actual) if e == a)
    return round(hits / max(len(expected), len(actual)), 2)

print(tool_sequence_score(["search", "read", "write"], ["search", "read", "write"]))
print(tool_sequence_score(["search", "read", "write"], ["search", "search", "read", "write"]))
```

Output:

```
1.0
0.25
```

## ज़रूरत से ज़्यादा न बाँधें

कई मान्य रास्ते हो सकते हैं। "निषिद्ध tool उपयोग" या "8 calls से ज़्यादा" को कड़ी विफलता मानें, और एक तय क्रम माँगने की जगह सटीक क्रम को नरम संकेत मानें।

**Quiz:** सिर्फ़ अंतिम उत्तर नहीं, tool-call का रास्ता भी क्यों जाँचें?

- [ ] रास्ते हमेशा एक-जैसे होते हैं
- [ ] यह अपने आप agents को तेज़ करता है
- [ ] अंतिम उत्तर जाँचे नहीं जा सकते
- [x] सही उत्तर बेकार या असुरक्षित steps छिपा सकता है

*Answer:* सही उत्तर बेकार या असुरक्षित steps छिपा सकता है. Path scoring बेकार ख़र्च, दोहराए calls और जोखिम भरे कर्म पकड़ता है जिन्हें सही उत्तर ढक सकता है।
