# Revision: Cheat Sheet और Self-Check — LLM Engineering की बुनियाद

Source: https://www.geekswithgeeks.com/hi/llm-engineering/z-revision

> पूरे कोर्स के मुख्य विचार दोहराएँ।

## Cheat sheet

**मानसिकता**: LLM आउटपुट अनिश्चित और निर्दिष्ट करना कठिन है, इसलिए उसके आसपास engineering करें: मापें, version करें, द्वार लगाएँ, देखें, बाँधें। **परिभाषित**: बनाने से पहले metrics और लक्ष्य (गुणवत्ता, faithfulness, वैधता, latency, लागत, सुरक्षा, व्यावसायिक प्रभाव); चरणबद्ध रास्ता prototype, eval set, दोहराव, मज़बूती, pilot, rollout, संचालन। **मूल्यांकन**: पहले programmatic scorers वाला harness; श्रेणियाँ और held-out set; confidence intervals (bootstrap) क्योंकि छोटे sets शोर वाले हैं; असहमतियों पर paired sign test; LLM-as-judge को calibration (कच्ची सहमति नहीं, kappa) और क्रम बदलना चाहिए; leakage से बचें (n-gram overlap जाँच)। **Engineering**: release ID सहित versioned बंडल के रूप में prompt+मॉडल+settings; गुणवत्ता, सुरक्षा, latency, लागत पर CI द्वार; validation और सीमित repair loop सहित संरचित आउटपुट; पहले prompting, फिर RAG, फिर fine-tuning (LoRA weights के अंश को प्रशिक्षित करता है)। **अनुकूलन**: सटीक, normalised और semantic caching; सिरे-से-सिरे आँके cascades/routers; percentiles, timeouts, streaming, hedging; क्षमता के लिए Little का नियम; प्रति हल कार्य लागत। **संचालन**: spans वाले traces; drift (PSI) और गुणवत्ता sampling; परतदार विफलता-सँभाल और विफलता अभ्यास; संख्याओं से hosted बनाम self-hosted; memory, batching, quantisation; shadow, canary, ramp, एक-चरण rollback। **शासन**: सुरक्षा की बुनियाद, privacy व डेटा-प्रवाह नक़्शे, system card, भूमिकाएँ, दोषारोपण-रहित समीक्षाएँ।

**Quiz:** 40 में से prompt B, prompt A से 3 और मामले पास करता है, और A वे 2 पास करता है जो B विफल। क्या B स्पष्ट रूप से बेहतर है?

- [ ] हाँ, हमेशा ऊँचा score चुनें
- [x] नहीं: 5 बनाम 2 असहमतियाँ शोर के भीतर हैं; निर्णय से पहले और मामले जुटाएँ
- [ ] हाँ, क्योंकि B नया है
- [ ] दोनों आँके नहीं जा सकते

*Answer:* नहीं: 5 बनाम 2 असहमतियाँ शोर के भीतर हैं; निर्णय से पहले और मामले जुटाएँ. छोटे sets पर छोटे अंतर संयोग से अलग नहीं पहचाने जा सकते।

**Quiz:** आपका LLM judge मनुष्यों से 70% सहमत है, पर 70% labels "good" हैं। आपको क्या जाँचना चाहिए?

- [ ] क्या judge rubric से लंबा है
- [ ] कुछ नहीं, 70% शानदार है
- [ ] Prompt का font
- [x] Cohen's kappa, क्योंकि label असंतुलन से कच्ची सहमति फूली हुई है

*Answer:* Cohen's kappa, क्योंकि label असंतुलन से कच्ची सहमति फूली हुई है. हमेशा "good" कहने वाला judge भी 70% कच्ची सहमति पाएगा।

**Quiz:** अनुरोध प्रति सेकंड 40 हैं और प्रत्येक औसतन 5 सेकंड लेता है। एक साथ लगभग कितने उड़ान में हैं?

- [x] 200
- [ ] 8
- [ ] 45
- [ ] 0.125

*Answer:* 200. उड़ान में = दर x latency = 40 x 5।
