# Privacy, अनुपालन और डेटा सँभाल — LLM Engineering की बुनियाद

Source: https://www.geekswithgeeks.com/hi/llm-engineering/g-privacy

> जानें आपके system से क्या बाहर जाता है और आपको क्या दिखा पाना है।

## डेटा प्रवाह ही अनुपालन की कहानी है

अनुपालन के सवाल **डेटा प्रवाह** से शुरू होते हैं: कौन-सा व्यक्तिगत या गोपनीय डेटा prompts में आता है, कहाँ भेजा जाता है (कौन-सा provider, कौन-सा क्षेत्र), कितने समय संचित रहता है (provider retention, आपके logs, caches, fine-tuning sets, vector indexes), कौन पहुँच सकता है, और किसी व्यक्ति का डेटा जहाँ-जहाँ पहुँचा वहाँ से कैसे **हटाया** जा सकता है। व्यावहारिक क़दम: प्रवाह नक़्शा बनाएँ; **न्यूनतम और redact** करें; उपयुक्त **डेटा-उपयोग, retention और residency शर्तों** वाले providers चुनें, और आपके संगठन के आवश्यक समझौतों पर हस्ताक्षर करें; जहाँ क़ानून या नैतिकता माँगे वहाँ users को **सूचना और विकल्प** दें; logs और indexes पर **access control और encryption** लगाएँ; caches, indexes और logs में **हटाने के अनुरोध** समर्थित करें; और **रिकॉर्ड** रखें (किस मॉडल और prompt ने कौन-सा निर्णय बनाया) ताकि आप परिणाम समझा सकें। क्षेत्रीय नियम (स्वास्थ्य, वित्त, शिक्षा) और क्षेत्रीय क़ानून आवश्यकताएँ जोड़ते हैं, इसलिए अपनी privacy और legal टीमों को launch पर नहीं, शुरू में शामिल करें।

## Privacy और legal को जल्दी शामिल करें

Launch के बाद अनुपालन बाद में जोड़ना कहीं कठिन है।

**Quiz:** LLM systems में किसी व्यक्ति का डेटा हटाना कठिन क्यों है?

- [x] Copies logs, caches, vector indexes और fine-tuning डेटा में हो सकती हैं
- [ ] मॉडल हटाना मना करते हैं
- [ ] डेटा कभी संचित नहीं होता
- [ ] यह हर जगह आसान है

*Answer:* Copies logs, caches, vector indexes और fine-tuning डेटा में हो सकती हैं. डेटा प्रवाह का नक़्शा बनाएँ ताकि हर copy खोजी और हटाई जा सके।
