पाठ 25 / 28

Monitoring, पहचान और Logging

Production में दुरुपयोग पर नज़र रखें, privacy समस्या बनाए बिना।

देखने योग्य संकेत

Production में जाँच और पहचान के लिए पर्याप्त log करें: प्रति user अनुरोध, रोके या चिह्नित इनपुट, canary-token hits (prompt लीक), नीति denials और अनुमोदन परिणाम, (redacted) arguments सहित tool calls, इनकार, validation विफलताएँ, प्रति user और सुविधा token व लागत, और latency व error दरें। विसंगतियों पर alert लगाएँ: injection जैसे इनपुट की बौछार, user का बार-बार denials से टकराना, लागत या tool calls में अचानक उछाल, असामान्य क्रम में बुलाए tools, संपर्क किए गए नए बाहरी hosts, या secrets अथवा व्यक्तिगत डेटा वाले आउटपुट। इसे privacy से संतुलित करें: संवेदनशील मान redact करें, logs कौन पढ़े यह सीमित करें, retention सीमाएँ लगाएँ और logs को संवेदनशील डेटा मानें। पहचान अकेले हमला नहीं रोकती, इसलिए उसे प्रतिक्रिया से जोड़ें: user को रोकने, tool या सुविधा बंद करने, और prompt या मॉडल वापस लेने की क्षमता।

रखने योग्य alerts

सीमाएँ उदाहरण हैं; अपने traffic के अनुसार tune करें।

Signal                                         Example alert rule
canary token appears in an output              any hit -> page security, block the response
>= 5 policy denials by one user in 10 min      flag the account for review
tool calls per request > 3x normal             investigate possible loop or injection
cost per hour > 3x the 7-day baseline          alert + automatic spend cap
new outbound hostname from a tool              alert; require approval before allowing
secret/PII pattern in model output             block, redact, alert

लागत उछाल पर alert दें

ख़र्च में अचानक उछाल अक्सर दुरुपयोग या बेक़ाबू loop का पहला संकेत है।

त्वरित जाँच: System prompt का canary token किसी उत्तर में दिखता है। यह क्या दर्शाता है?

  • मॉडल तेज़ है
  • सब ठीक है
  • System prompt लीक हुआ और प्रतिक्रिया रोकी व समीक्षा की जानी चाहिए
  • User developer है
Answer

System prompt लीक हुआ और प्रतिक्रिया रोकी व समीक्षा की जानी चाहिए — Canaries चुपचाप लीक को पहचानने योग्य घटना बनाते हैं।