पाठ 2 / 28

Assets, हमलावर और भरोसे की सीमाएँ

System खींचें और चिह्नित करें अविश्वसनीय पाठ कहाँ प्रवेश करता है।

जो बचाना है उससे शुरू करें

LLM app का threat modelling किसी भी अन्य की तरह शुरू होता है। Assets: ग्राहक डेटा, आंतरिक दस्तावेज़, credentials और API keys, system prompt और व्यावसायिक तर्क, API बिल के पीछे का पैसा, उत्पाद की साख, और वे कार्रवाइयाँ जो app कर सकता है (ईमेल भेजना, पैसा हिलाना, records बदलना)। हमलावर: जिज्ञासु या दुर्भावनापूर्ण user; बाहरी व्यक्ति जिसका पाठ मॉडल तक अप्रत्यक्ष रूप से पहुँचता है (web page, ईमेल, PDF, review); compromised तृतीय-पक्ष (plugin, dataset, model provider); और अंदरूनी व्यक्ति। भरोसे की सीमाएँ: हर उस जगह को खींचें जहाँ कम-भरोसेमंद स्रोत का पाठ prompt में आता है (user इनपुट, retrieved दस्तावेज़, tool आउटपुट, web सामग्री, अपलोड की files, अन्य agents) और हर उस जगह को जहाँ मॉडल आउटपुट अधिक-विशेषाधिकार वाले घटक के पास जाता है (database, browser, shell, ईमेल system, दूसरी सेवा)। हर पार करना नियंत्रण की जगह है।

भरोसा-सीमा कार्यपत्र

अपने application के लिए एक भरें।

ENTRY POINTS (untrusted text -> prompt)        EXIT POINTS (model output -> privileged component)
user chat messages                              HTML page in the browser            (XSS risk)
retrieved documents / web pages                 SQL / shell / file path built from output (injection)
uploaded files, emails, tickets                 tool calls (send email, refund, delete)  (agency)
tool outputs, API responses, other agents       logs, analytics, other users' views     (data leak)

For each line ask: who controls this text? what can the next component do with it? what stops abuse?

अप्रत्यक्ष स्रोत शामिल करें

वह सामग्री सूचीबद्ध करें जो मॉडल user की ओर से पढ़ता है (ईमेल, pages, files); अप्रत्यक्ष हमले वहीं आते हैं।

त्वरित जाँच: कौन-सा entry point है जहाँ अविश्वसनीय पाठ prompt तक पहुँच सकता है?

  • Retrieved web page या दस्तावेज़
  • GPU driver संस्करण
  • Wi-Fi password
  • Monitor की चमक
Answer

Retrieved web page या दस्तावेज़ — मॉडल जो भी सामग्री पढ़े वह संभावित निर्देश स्रोत है।