# Revision: Cheat Sheet और Self-Check — Large Language Models

Source: https://www.geekswithgeeks.com/hi/llms/v-revision

> पूरे कोर्स के मुख्य विचार दोहराएँ।

## Cheat sheet

**मूल**: LLM अगला token अनुमानित करता है; पाठ BPE tokens में बँटता है; tokens embeddings बनते हैं; temperature वाला softmax logits को संभावनाएँ बनाता है; greedy, top-k और top-p token चुनते हैं। **Transformer**: self-attention (query, key, value; scaled dot products का softmax), causal mask, MLP, residuals, normalisation और positions वाले stacked blocks; KV cache स्मृति से गति ख़रीदता है; context window कठोर सीमा है। **Training**: next-token loss पर pretraining (perplexity = exp(loss)), scaling laws, SFT, LoRA, RLHF/DPO। **उपयोग**: उदाहरणों वाले स्पष्ट prompts, वर्तमान व स्रोत-योग्य तथ्यों के लिए RAG, validation सहित tools, लागत tokens में गिनें। **गुणवत्ता**: तयशुदा eval set, groundedness, citations सत्यापित करें, तथ्यों के लिए कम temperature। **सुरक्षा**: prompt injection, न्यूनतम विशेषाधिकार, privacy, bias, मानव अनुमोदन। **Deploy**: स्मृति = parameters × bytes, quantization, streaming, hosted बनाम open मॉडल।

**Quiz:** मॉडल पिछले हफ़्ते के नीति बदलाव पर ग़लत उत्तर देता है। कौन-सा सुधार सबसे ठीक है?

- [ ] शब्दावली छोटी करें
- [ ] Temperature बढ़ाएँ
- [ ] एक उदाहरण पर fine-tune करें
- [x] Retrieval जोड़ें ताकि वर्तमान नीति का पाठ prompt में रखा जाए

*Answer:* Retrieval जोड़ें ताकि वर्तमान नीति का पाठ prompt में रखा जाए. ताज़ा, स्रोत-योग्य तथ्य weights में नहीं, retrieval से prompt में रखे जाते हैं।

**Quiz:** बहुत कम temperature वाला softmax लगभग हर बार वही token क्यों देता है?

- [ ] यह शब्दावली से अन्य tokens हटा देता है
- [x] यह शीर्ष logit के आसपास वितरण को बहुत तीखा कर देता है
- [ ] यह मॉडल को दोबारा प्रशिक्षित करता है
- [ ] यह और परतें जोड़ता है

*Answer:* यह शीर्ष logit के आसपास वितरण को बहुत तीखा कर देता है. Logits को छोटी संख्या से भाग देने से अंतर बढ़ते हैं और संभावना केंद्रित हो जाती है।

**Quiz:** Causal mask क्या सुनिश्चित करता है?

- [ ] आउटपुट हमेशा सत्य है
- [x] कोई स्थिति बाद की स्थितियों की जानकारी उपयोग नहीं कर सकती
- [ ] Prompt छोटा है
- [ ] मॉडल quantized है

*Answer:* कोई स्थिति बाद की स्थितियों की जानकारी उपयोग नहीं कर सकती. भविष्य के scores ऋण-अनंत होते हैं इसलिए उनके attention weights 0 होते हैं।
