पाठ 26 / 29
Privacy, अनुपालन और डेटा सँभाल
जानें आपके system से क्या बाहर जाता है और आपको क्या दिखा पाना है।
डेटा प्रवाह ही अनुपालन की कहानी है
अनुपालन के सवाल डेटा प्रवाह से शुरू होते हैं: कौन-सा व्यक्तिगत या गोपनीय डेटा prompts में आता है, कहाँ भेजा जाता है (कौन-सा provider, कौन-सा क्षेत्र), कितने समय संचित रहता है (provider retention, आपके logs, caches, fine-tuning sets, vector indexes), कौन पहुँच सकता है, और किसी व्यक्ति का डेटा जहाँ-जहाँ पहुँचा वहाँ से कैसे हटाया जा सकता है। व्यावहारिक क़दम: प्रवाह नक़्शा बनाएँ; न्यूनतम और redact करें; उपयुक्त डेटा-उपयोग, retention और residency शर्तों वाले providers चुनें, और आपके संगठन के आवश्यक समझौतों पर हस्ताक्षर करें; जहाँ क़ानून या नैतिकता माँगे वहाँ users को सूचना और विकल्प दें; logs और indexes पर access control और encryption लगाएँ; caches, indexes और logs में हटाने के अनुरोध समर्थित करें; और रिकॉर्ड रखें (किस मॉडल और prompt ने कौन-सा निर्णय बनाया) ताकि आप परिणाम समझा सकें। क्षेत्रीय नियम (स्वास्थ्य, वित्त, शिक्षा) और क्षेत्रीय क़ानून आवश्यकताएँ जोड़ते हैं, इसलिए अपनी privacy और legal टीमों को launch पर नहीं, शुरू में शामिल करें।
Privacy और legal को जल्दी शामिल करें
Launch के बाद अनुपालन बाद में जोड़ना कहीं कठिन है।
त्वरित जाँच: LLM systems में किसी व्यक्ति का डेटा हटाना कठिन क्यों है?
- Copies logs, caches, vector indexes और fine-tuning डेटा में हो सकती हैं
- मॉडल हटाना मना करते हैं
- डेटा कभी संचित नहीं होता
- यह हर जगह आसान है
Answer
Copies logs, caches, vector indexes और fine-tuning डेटा में हो सकती हैं — डेटा प्रवाह का नक़्शा बनाएँ ताकि हर copy खोजी और हटाई जा सके।