# प्रभाव क्षेत्र: Compromised मॉडल क्या कर सकता है — LLM Application Security

Source: https://www.geekswithgeeks.com/hi/llm-security/t-radius

> जोखिम इससे मापें कि मॉडल को कहाँ तक पहुँच है।

## मानें कि injection चलता है; नुक़सान सीमित करें

चूँकि prompt injection आज पूरी तरह रोका नहीं जा सकता, सबसे भरोसेमंद सुरक्षा-सवाल "क्या मॉडल को बहकाया जा सकता है?" नहीं बल्कि "**यदि बहकाया गया, तो सबसे बुरा क्या कर सकता है?**" है। वह सबसे बुरा मामला **प्रभाव क्षेत्र** है, जो आपके सौंपे सामर्थ्य से तय होता है। सिर्फ़ पाठ लौटा सकने वाले summariser का क्षेत्र छोटा है (बुरे से बुरा, भ्रामक पाठ)। प्रति-user डेटा पहुँच जोड़ें और सफल injection उस user का डेटा लीक कर सकता है; किसी भी ग्राहक का डेटा पढ़ने की क्षमता जोड़ें तो सबका; ईमेल जोड़ें तो हमलावर को डेटा निकाल सकता है; refunds जोड़ें तो पैसा हिला सकता है; shell commands जोड़ें तो host को compromise कर सकता है। ख़तरनाक संयोजन **"lethal trifecta"** है: **निजी डेटा** तक पहुँच, **अविश्वसनीय सामग्री** का संपर्क, और **बाहर संवाद** का रास्ता। इन तीनों में से कम से कम एक हटाकर जोखिम घटाएँ।

## क्षमताएँ और प्रभाव क्षेत्र, चलाकर

मैंने यह सादे Python 3 (सिर्फ़ standard library) से चलाया। यहाँ सारे हमले स्थानीय डेटा पर हानिरहित प्रदर्शन हैं, कोई असली system उपयोग नहीं हुआ। हर जोड़ी गई क्षमता सफल injection का सबसे-बुरा-मामला असर बढ़ाती है, 0 (सिर्फ़ पाठ) से 6 (shell पहुँच) तक। Scores सिखाने का पैमाना हैं, मानक नहीं।

```python
# Estimating how much an attacker gains from a successful injection depends on what the app can reach.
capabilities = {
    "summarise text only": 0,
    "+ read the user's own orders": 1,
    "+ read any customer's data": 3,
    "+ send email": 4,
    "+ issue refunds": 5,
    "+ run shell commands": 6,
}
print("capability                         blast radius (0-6)")
for name, level in capabilities.items(): print(f"{name:34} {'#' * level}{'.' * (6 - level)} {level}")

```

Output:

```
capability                         blast radius (0-6)
summarise text only                ...... 0
+ read the user's own orders       #..... 1
+ read any customer's data         ###... 3
+ send email                       ####.. 4
+ issue refunds                    #####. 5
+ run shell commands               ###### 6
```

## Trifecta की एक कड़ी हटाएँ

यदि निजी डेटा, अविश्वसनीय सामग्री और बाहर संवाद एक साथ न हों, तो हमलों की पूरी श्रेणी का लाभ ख़त्म हो जाता है।

**Quiz:** कौन-सा संयोजन "lethal trifecta" है?

- [ ] Logging + metrics + dashboards
- [ ] तेज़ GPU + बड़ी RAM + सस्ता भंडारण
- [ ] छोटा prompt + कम temperature + छोटा मॉडल
- [x] निजी डेटा + अविश्वसनीय सामग्री + बाहरी संवाद

*Answer:* निजी डेटा + अविश्वसनीय सामग्री + बाहरी संवाद. तीनों के साथ injection secrets पढ़कर बाहर भेज सकता है।
