पाठ 25 / 28
Monitoring, पहचान और Logging
Production में दुरुपयोग पर नज़र रखें, privacy समस्या बनाए बिना।
देखने योग्य संकेत
Production में जाँच और पहचान के लिए पर्याप्त log करें: प्रति user अनुरोध, रोके या चिह्नित इनपुट, canary-token hits (prompt लीक), नीति denials और अनुमोदन परिणाम, (redacted) arguments सहित tool calls, इनकार, validation विफलताएँ, प्रति user और सुविधा token व लागत, और latency व error दरें। विसंगतियों पर alert लगाएँ: injection जैसे इनपुट की बौछार, user का बार-बार denials से टकराना, लागत या tool calls में अचानक उछाल, असामान्य क्रम में बुलाए tools, संपर्क किए गए नए बाहरी hosts, या secrets अथवा व्यक्तिगत डेटा वाले आउटपुट। इसे privacy से संतुलित करें: संवेदनशील मान redact करें, logs कौन पढ़े यह सीमित करें, retention सीमाएँ लगाएँ और logs को संवेदनशील डेटा मानें। पहचान अकेले हमला नहीं रोकती, इसलिए उसे प्रतिक्रिया से जोड़ें: user को रोकने, tool या सुविधा बंद करने, और prompt या मॉडल वापस लेने की क्षमता।
रखने योग्य alerts
सीमाएँ उदाहरण हैं; अपने traffic के अनुसार tune करें।
Signal Example alert rule
canary token appears in an output any hit -> page security, block the response
>= 5 policy denials by one user in 10 min flag the account for review
tool calls per request > 3x normal investigate possible loop or injection
cost per hour > 3x the 7-day baseline alert + automatic spend cap
new outbound hostname from a tool alert; require approval before allowing
secret/PII pattern in model output block, redact, alertलागत उछाल पर alert दें
ख़र्च में अचानक उछाल अक्सर दुरुपयोग या बेक़ाबू loop का पहला संकेत है।
त्वरित जाँच: System prompt का canary token किसी उत्तर में दिखता है। यह क्या दर्शाता है?
- मॉडल तेज़ है
- सब ठीक है
- System prompt लीक हुआ और प्रतिक्रिया रोकी व समीक्षा की जानी चाहिए
- User developer है
Answer
System prompt लीक हुआ और प्रतिक्रिया रोकी व समीक्षा की जानी चाहिए — Canaries चुपचाप लीक को पहचानने योग्य घटना बनाते हैं।