पाठ 2 / 25

आम विफलता के प्रकार

Hallucination, हानिकारक output, privacy leaks, पक्षपात, दुरुपयोग और अति-निर्भरता पहचानें।

जो छह चीज़ें बिगड़ती हैं

Hallucination: प्रवाहपूर्ण पर ग़लत या गढ़ा उत्तर। हानिकारक सामग्री: अपमानजनक, ख़तरनाक या अनुचित text। Privacy leaks: prompt, दस्तावेज़ या किसी और user के session से दोहराया गया व्यक्तिगत डेटा। पक्षपात: कुछ समूहों के लिए ख़राब नतीजे या लहजा। दुरुपयोग: कोई system को ऐसा करने को मोड़े जो उसे नहीं करना चाहिए (injection, jailbreaks, spam)। अति-निर्भरता: users का बिना जाँचे उत्तरों पर भरोसा। हर एक का अलग safeguard है, इसलिए विफलता का नाम बताना पहला कदम है।

विफलता से safeguard तक

शुरुआती नक़्शा। असली systems में हर पंक्ति के लिए कई safeguards होते हैं।

Failure mode        First safeguards
Hallucination       ground answers in documents, cite sources, say "I don't know"
Harmful content     moderation on input and output, clear policies
Privacy leak        minimise data, redact PII, isolate user sessions
Bias                test across groups, review failures, human review
Misuse              least-privilege tools, rate limits, injection defences
Over-reliance       show uncertainty, link evidence, human sign-off on high stakes

त्वरित जाँच: Model आत्मविश्वास से ऐसी नीति बताता है जो है ही नहीं। यह कौन-सी विफलता है?

  • Hallucination
  • Rate limiting
  • Caching
  • Compression
Answer

Hallucination — प्रवाहपूर्ण गढ़ा उत्तर hallucination की पुरानी परिभाषा है।