पाठ 4 / 28

मुख्य जोखिम-परिवारों का नक़्शा

इस कोर्स में आने वाले जोखिमों और उनके जुड़ाव का पूर्वावलोकन करें।

दस-बारह जोखिम, चार विषय

सामान्य जोखिम-सूचियाँ चार विषयों में समूहित होती हैं। हेरफेर: prompt injection (प्रत्यक्ष और अप्रत्यक्ष), jailbreaks, system-prompt लीक। असुरक्षित परिणाम: मॉडल आउटपुट की असुरक्षित सँभाल (XSS, SQL injection, command injection, path traversal, SSRF), अति-स्वायत्तता, ग़लत उत्तरों पर अति-निर्भरता। डेटा और ज्ञान: संवेदनशील जानकारी का प्रकटन, प्रशिक्षण-डेटा या retrieval poisoning, embeddings और vector stores की कमज़ोरियाँ, RAG access-control विफलताएँ। Platform और संसाधन: supply chain (मॉडल, packages, plugins, serialised files), असीमित खपत (denial of service, denial of wallet), और monitoring की कमियाँ। उपाय उसी छोटी सूची के सिद्धांतों से आते हैं: न्यूनतम विशेषाधिकार, सीमा पार करती हर चीज़ validate करना, जोखिम भरी कार्रवाइयों के लिए मनुष्य को लूप में रखना, जहाँ संभव डेटा को निर्देशों से अलग रखना, संसाधन सीमित करना, log और परीक्षण। बाक़ी कोर्स इन्हें ठोस अभ्यास में बदलता है।

जोखिम-परिवार और मुख्य नियंत्रण

आगे के खंडों के लिए cheat sheet।

Theme              Risk                                   Main controls
Manipulation       prompt injection, jailbreak, prompt leak   data/instruction separation, least privilege, approvals, never keep secrets in prompts
Unsafe consequence insecure output handling                   escape / parameterise / allow-list / validate before use
                   excessive agency                           narrow tools, per-user auth, human approval, audit
Data & knowledge   sensitive disclosure, RAG leaks, poisoning access control in retrieval, redaction, provenance, minimal retention
Platform           supply chain, unbounded consumption         pin & verify models/packages, safe formats, rate and spend limits, monitoring

रखरखाव वाली checklist उपयोग करें

OWASP Top 10 for LLM Applications से शुरू करें और अपने system के अनुसार ढालें; सूची समय के साथ बदलती है।

त्वरित जाँच: अधिकांश उपायों के पीछे कौन-सा सिद्धांत है?

  • लंबे prompts उपयोग करना
  • न्यूनतम विशेषाधिकार और सीमा पार करती हर चीज़ को validate करना
  • मॉडल का नाम छिपाना
  • ज़्यादा GPUs उपयोग करना
Answer

न्यूनतम विशेषाधिकार और सीमा पार करती हर चीज़ को validate करना — क्लासिक सुरक्षा सिद्धांत अब भी लागू होते हैं और अधिकांश काम करते हैं।