पाठ 2 / 25
आम विफलता के प्रकार
Hallucination, हानिकारक output, privacy leaks, पक्षपात, दुरुपयोग और अति-निर्भरता पहचानें।
जो छह चीज़ें बिगड़ती हैं
Hallucination: प्रवाहपूर्ण पर ग़लत या गढ़ा उत्तर। हानिकारक सामग्री: अपमानजनक, ख़तरनाक या अनुचित text। Privacy leaks: prompt, दस्तावेज़ या किसी और user के session से दोहराया गया व्यक्तिगत डेटा। पक्षपात: कुछ समूहों के लिए ख़राब नतीजे या लहजा। दुरुपयोग: कोई system को ऐसा करने को मोड़े जो उसे नहीं करना चाहिए (injection, jailbreaks, spam)। अति-निर्भरता: users का बिना जाँचे उत्तरों पर भरोसा। हर एक का अलग safeguard है, इसलिए विफलता का नाम बताना पहला कदम है।
विफलता से safeguard तक
शुरुआती नक़्शा। असली systems में हर पंक्ति के लिए कई safeguards होते हैं।
Failure mode First safeguards
Hallucination ground answers in documents, cite sources, say "I don't know"
Harmful content moderation on input and output, clear policies
Privacy leak minimise data, redact PII, isolate user sessions
Bias test across groups, review failures, human review
Misuse least-privilege tools, rate limits, injection defences
Over-reliance show uncertainty, link evidence, human sign-off on high stakesत्वरित जाँच: Model आत्मविश्वास से ऐसी नीति बताता है जो है ही नहीं। यह कौन-सी विफलता है?
- Hallucination
- Rate limiting
- Caching
- Compression
Answer
Hallucination — प्रवाहपूर्ण गढ़ा उत्तर hallucination की पुरानी परिभाषा है।