# Agents के लिए Evals — एडवांस्ड Agent Workflows और Skills

Source: https://www.geekswithgeeks.com/hi/agent-workflows/rel-evals

> साफ़ pass/fail नियमों वाले कामों का छोटा test set बनाएँ और हर बदलाव पर चलाएँ।

## Prompts के लिए tests

**Eval** उदाहरण कामों का समूह है जिसमें हर नतीजे को अंक देने का तरीक़ा होता है। Prompt, skill या model बदलने पर इसे चलाएँ, ताकि एक भाग्यशाली उदाहरण से अंदाज़ा लगाने की जगह दिखे कि गुणवत्ता बढ़ी या घटी। 10 से 20 यथार्थपूर्ण मामलों से शुरू करें, जिनमें वे भी हों जो पहले विफल हुए थे।

## छोटा eval harness

हर मामले में एक input और checker function है। दूसरे model से पूछने की जगह सटीक जाँचें (contains, parse होना, tests पास) चुनें।

```python
cases = [
    ("Refund order 123", lambda out: "refund" in out.lower()),
    ("Cancel order 456", lambda out: "cancel" in out.lower()),
]

passed = sum(check(run_agent(prompt)) for prompt, check in cases)
print(f"{passed}/{len(cases)} passed")
```

## विफलताओं का संग्रह रखें

आपको मिली हर असली विफलता नया eval मामला बनती है। समय के साथ यह set वही पकड़ता है जो आपके users को मिलता है, और regressions जल्दी पकड़ में आते हैं।

**Quiz:** आपको अपने evals कब चलाने चाहिए?

- [ ] कभी नहीं, अंदाज़ा काफ़ी है
- [ ] लॉन्च से पहले सिर्फ़ एक बार
- [x] जब भी prompt, skill या model बदले
- [ ] सिर्फ़ तब जब users शिकायत करें

*Answer:* जब भी prompt, skill या model बदले. हर बदलाव के बाद दोबारा चलाने से regressions तुरंत दिखते हैं।
