पाठ 2 / 28
Assets, हमलावर और भरोसे की सीमाएँ
System खींचें और चिह्नित करें अविश्वसनीय पाठ कहाँ प्रवेश करता है।
जो बचाना है उससे शुरू करें
LLM app का threat modelling किसी भी अन्य की तरह शुरू होता है। Assets: ग्राहक डेटा, आंतरिक दस्तावेज़, credentials और API keys, system prompt और व्यावसायिक तर्क, API बिल के पीछे का पैसा, उत्पाद की साख, और वे कार्रवाइयाँ जो app कर सकता है (ईमेल भेजना, पैसा हिलाना, records बदलना)। हमलावर: जिज्ञासु या दुर्भावनापूर्ण user; बाहरी व्यक्ति जिसका पाठ मॉडल तक अप्रत्यक्ष रूप से पहुँचता है (web page, ईमेल, PDF, review); compromised तृतीय-पक्ष (plugin, dataset, model provider); और अंदरूनी व्यक्ति। भरोसे की सीमाएँ: हर उस जगह को खींचें जहाँ कम-भरोसेमंद स्रोत का पाठ prompt में आता है (user इनपुट, retrieved दस्तावेज़, tool आउटपुट, web सामग्री, अपलोड की files, अन्य agents) और हर उस जगह को जहाँ मॉडल आउटपुट अधिक-विशेषाधिकार वाले घटक के पास जाता है (database, browser, shell, ईमेल system, दूसरी सेवा)। हर पार करना नियंत्रण की जगह है।
भरोसा-सीमा कार्यपत्र
अपने application के लिए एक भरें।
ENTRY POINTS (untrusted text -> prompt) EXIT POINTS (model output -> privileged component)
user chat messages HTML page in the browser (XSS risk)
retrieved documents / web pages SQL / shell / file path built from output (injection)
uploaded files, emails, tickets tool calls (send email, refund, delete) (agency)
tool outputs, API responses, other agents logs, analytics, other users' views (data leak)
For each line ask: who controls this text? what can the next component do with it? what stops abuse?अप्रत्यक्ष स्रोत शामिल करें
वह सामग्री सूचीबद्ध करें जो मॉडल user की ओर से पढ़ता है (ईमेल, pages, files); अप्रत्यक्ष हमले वहीं आते हैं।
त्वरित जाँच: कौन-सा entry point है जहाँ अविश्वसनीय पाठ prompt तक पहुँच सकता है?
- Retrieved web page या दस्तावेज़
- GPU driver संस्करण
- Wi-Fi password
- Monitor की चमक
Answer
Retrieved web page या दस्तावेज़ — मॉडल जो भी सामग्री पढ़े वह संभावित निर्देश स्रोत है।