पाठ 4 / 28
मुख्य जोखिम-परिवारों का नक़्शा
इस कोर्स में आने वाले जोखिमों और उनके जुड़ाव का पूर्वावलोकन करें।
दस-बारह जोखिम, चार विषय
सामान्य जोखिम-सूचियाँ चार विषयों में समूहित होती हैं। हेरफेर: prompt injection (प्रत्यक्ष और अप्रत्यक्ष), jailbreaks, system-prompt लीक। असुरक्षित परिणाम: मॉडल आउटपुट की असुरक्षित सँभाल (XSS, SQL injection, command injection, path traversal, SSRF), अति-स्वायत्तता, ग़लत उत्तरों पर अति-निर्भरता। डेटा और ज्ञान: संवेदनशील जानकारी का प्रकटन, प्रशिक्षण-डेटा या retrieval poisoning, embeddings और vector stores की कमज़ोरियाँ, RAG access-control विफलताएँ। Platform और संसाधन: supply chain (मॉडल, packages, plugins, serialised files), असीमित खपत (denial of service, denial of wallet), और monitoring की कमियाँ। उपाय उसी छोटी सूची के सिद्धांतों से आते हैं: न्यूनतम विशेषाधिकार, सीमा पार करती हर चीज़ validate करना, जोखिम भरी कार्रवाइयों के लिए मनुष्य को लूप में रखना, जहाँ संभव डेटा को निर्देशों से अलग रखना, संसाधन सीमित करना, log और परीक्षण। बाक़ी कोर्स इन्हें ठोस अभ्यास में बदलता है।
जोखिम-परिवार और मुख्य नियंत्रण
आगे के खंडों के लिए cheat sheet।
Theme Risk Main controls
Manipulation prompt injection, jailbreak, prompt leak data/instruction separation, least privilege, approvals, never keep secrets in prompts
Unsafe consequence insecure output handling escape / parameterise / allow-list / validate before use
excessive agency narrow tools, per-user auth, human approval, audit
Data & knowledge sensitive disclosure, RAG leaks, poisoning access control in retrieval, redaction, provenance, minimal retention
Platform supply chain, unbounded consumption pin & verify models/packages, safe formats, rate and spend limits, monitoringरखरखाव वाली checklist उपयोग करें
OWASP Top 10 for LLM Applications से शुरू करें और अपने system के अनुसार ढालें; सूची समय के साथ बदलती है।
त्वरित जाँच: अधिकांश उपायों के पीछे कौन-सा सिद्धांत है?
- लंबे prompts उपयोग करना
- न्यूनतम विशेषाधिकार और सीमा पार करती हर चीज़ को validate करना
- मॉडल का नाम छिपाना
- ज़्यादा GPUs उपयोग करना
Answer
न्यूनतम विशेषाधिकार और सीमा पार करती हर चीज़ को validate करना — क्लासिक सुरक्षा सिद्धांत अब भी लागू होते हैं और अधिकांश काम करते हैं।