पाठ 21 / 25

Agents के लिए Evals

साफ़ pass/fail नियमों वाले कामों का छोटा test set बनाएँ और हर बदलाव पर चलाएँ।

Prompts के लिए tests

Eval उदाहरण कामों का समूह है जिसमें हर नतीजे को अंक देने का तरीक़ा होता है। Prompt, skill या model बदलने पर इसे चलाएँ, ताकि एक भाग्यशाली उदाहरण से अंदाज़ा लगाने की जगह दिखे कि गुणवत्ता बढ़ी या घटी। 10 से 20 यथार्थपूर्ण मामलों से शुरू करें, जिनमें वे भी हों जो पहले विफल हुए थे।

छोटा eval harness

हर मामले में एक input और checker function है। दूसरे model से पूछने की जगह सटीक जाँचें (contains, parse होना, tests पास) चुनें।

cases = [
    ("Refund order 123", lambda out: "refund" in out.lower()),
    ("Cancel order 456", lambda out: "cancel" in out.lower()),
]

passed = sum(check(run_agent(prompt)) for prompt, check in cases)
print(f"{passed}/{len(cases)} passed")

विफलताओं का संग्रह रखें

आपको मिली हर असली विफलता नया eval मामला बनती है। समय के साथ यह set वही पकड़ता है जो आपके users को मिलता है, और regressions जल्दी पकड़ में आते हैं।

त्वरित जाँच: आपको अपने evals कब चलाने चाहिए?

  • कभी नहीं, अंदाज़ा काफ़ी है
  • लॉन्च से पहले सिर्फ़ एक बार
  • जब भी prompt, skill या model बदले
  • सिर्फ़ तब जब users शिकायत करें
Answer

जब भी prompt, skill या model बदले — हर बदलाव के बाद दोबारा चलाने से regressions तुरंत दिखते हैं।