पाठ 3 / 28

प्रभाव क्षेत्र: Compromised मॉडल क्या कर सकता है

जोखिम इससे मापें कि मॉडल को कहाँ तक पहुँच है।

मानें कि injection चलता है; नुक़सान सीमित करें

चूँकि prompt injection आज पूरी तरह रोका नहीं जा सकता, सबसे भरोसेमंद सुरक्षा-सवाल "क्या मॉडल को बहकाया जा सकता है?" नहीं बल्कि "यदि बहकाया गया, तो सबसे बुरा क्या कर सकता है?" है। वह सबसे बुरा मामला प्रभाव क्षेत्र है, जो आपके सौंपे सामर्थ्य से तय होता है। सिर्फ़ पाठ लौटा सकने वाले summariser का क्षेत्र छोटा है (बुरे से बुरा, भ्रामक पाठ)। प्रति-user डेटा पहुँच जोड़ें और सफल injection उस user का डेटा लीक कर सकता है; किसी भी ग्राहक का डेटा पढ़ने की क्षमता जोड़ें तो सबका; ईमेल जोड़ें तो हमलावर को डेटा निकाल सकता है; refunds जोड़ें तो पैसा हिला सकता है; shell commands जोड़ें तो host को compromise कर सकता है। ख़तरनाक संयोजन "lethal trifecta" है: निजी डेटा तक पहुँच, अविश्वसनीय सामग्री का संपर्क, और बाहर संवाद का रास्ता। इन तीनों में से कम से कम एक हटाकर जोखिम घटाएँ।

क्षमताएँ और प्रभाव क्षेत्र, चलाकर

मैंने यह सादे Python 3 (सिर्फ़ standard library) से चलाया। यहाँ सारे हमले स्थानीय डेटा पर हानिरहित प्रदर्शन हैं, कोई असली system उपयोग नहीं हुआ। हर जोड़ी गई क्षमता सफल injection का सबसे-बुरा-मामला असर बढ़ाती है, 0 (सिर्फ़ पाठ) से 6 (shell पहुँच) तक। Scores सिखाने का पैमाना हैं, मानक नहीं।

# Estimating how much an attacker gains from a successful injection depends on what the app can reach.
capabilities = {
    "summarise text only": 0,
    "+ read the user's own orders": 1,
    "+ read any customer's data": 3,
    "+ send email": 4,
    "+ issue refunds": 5,
    "+ run shell commands": 6,
}
print("capability                         blast radius (0-6)")
for name, level in capabilities.items(): print(f"{name:34} {'#' * level}{'.' * (6 - level)} {level}")

Output:

capability                         blast radius (0-6)
summarise text only                ...... 0
+ read the user's own orders       #..... 1
+ read any customer's data         ###... 3
+ send email                       ####.. 4
+ issue refunds                    #####. 5
+ run shell commands               ###### 6

Trifecta की एक कड़ी हटाएँ

यदि निजी डेटा, अविश्वसनीय सामग्री और बाहर संवाद एक साथ न हों, तो हमलों की पूरी श्रेणी का लाभ ख़त्म हो जाता है।

त्वरित जाँच: कौन-सा संयोजन "lethal trifecta" है?

  • Logging + metrics + dashboards
  • तेज़ GPU + बड़ी RAM + सस्ता भंडारण
  • छोटा prompt + कम temperature + छोटा मॉडल
  • निजी डेटा + अविश्वसनीय सामग्री + बाहरी संवाद
Answer

निजी डेटा + अविश्वसनीय सामग्री + बाहरी संवाद — तीनों के साथ injection secrets पढ़कर बाहर भेज सकता है।