पाठ 27 / 27
Revision: Cheat Sheet और Self-Check
पूरे कोर्स के मुख्य विचार दोहराएँ।
Cheat sheet
मूल: LLM अगला token अनुमानित करता है; पाठ BPE tokens में बँटता है; tokens embeddings बनते हैं; temperature वाला softmax logits को संभावनाएँ बनाता है; greedy, top-k और top-p token चुनते हैं। Transformer: self-attention (query, key, value; scaled dot products का softmax), causal mask, MLP, residuals, normalisation और positions वाले stacked blocks; KV cache स्मृति से गति ख़रीदता है; context window कठोर सीमा है। Training: next-token loss पर pretraining (perplexity = exp(loss)), scaling laws, SFT, LoRA, RLHF/DPO। उपयोग: उदाहरणों वाले स्पष्ट prompts, वर्तमान व स्रोत-योग्य तथ्यों के लिए RAG, validation सहित tools, लागत tokens में गिनें। गुणवत्ता: तयशुदा eval set, groundedness, citations सत्यापित करें, तथ्यों के लिए कम temperature। सुरक्षा: prompt injection, न्यूनतम विशेषाधिकार, privacy, bias, मानव अनुमोदन। Deploy: स्मृति = parameters × bytes, quantization, streaming, hosted बनाम open मॉडल।
त्वरित जाँच: मॉडल पिछले हफ़्ते के नीति बदलाव पर ग़लत उत्तर देता है। कौन-सा सुधार सबसे ठीक है?
- शब्दावली छोटी करें
- Temperature बढ़ाएँ
- एक उदाहरण पर fine-tune करें
- Retrieval जोड़ें ताकि वर्तमान नीति का पाठ prompt में रखा जाए
Answer
Retrieval जोड़ें ताकि वर्तमान नीति का पाठ prompt में रखा जाए — ताज़ा, स्रोत-योग्य तथ्य weights में नहीं, retrieval से prompt में रखे जाते हैं।
त्वरित जाँच: बहुत कम temperature वाला softmax लगभग हर बार वही token क्यों देता है?
- यह शब्दावली से अन्य tokens हटा देता है
- यह शीर्ष logit के आसपास वितरण को बहुत तीखा कर देता है
- यह मॉडल को दोबारा प्रशिक्षित करता है
- यह और परतें जोड़ता है
Answer
यह शीर्ष logit के आसपास वितरण को बहुत तीखा कर देता है — Logits को छोटी संख्या से भाग देने से अंतर बढ़ते हैं और संभावना केंद्रित हो जाती है।
त्वरित जाँच: Causal mask क्या सुनिश्चित करता है?
- आउटपुट हमेशा सत्य है
- कोई स्थिति बाद की स्थितियों की जानकारी उपयोग नहीं कर सकती
- Prompt छोटा है
- मॉडल quantized है
Answer
कोई स्थिति बाद की स्थितियों की जानकारी उपयोग नहीं कर सकती — भविष्य के scores ऋण-अनंत होते हैं इसलिए उनके attention weights 0 होते हैं।