पाठ 27 / 27

Revision: Cheat Sheet और Self-Check

पूरे कोर्स के मुख्य विचार दोहराएँ।

Cheat sheet

मूल: LLM अगला token अनुमानित करता है; पाठ BPE tokens में बँटता है; tokens embeddings बनते हैं; temperature वाला softmax logits को संभावनाएँ बनाता है; greedy, top-k और top-p token चुनते हैं। Transformer: self-attention (query, key, value; scaled dot products का softmax), causal mask, MLP, residuals, normalisation और positions वाले stacked blocks; KV cache स्मृति से गति ख़रीदता है; context window कठोर सीमा है। Training: next-token loss पर pretraining (perplexity = exp(loss)), scaling laws, SFT, LoRA, RLHF/DPO। उपयोग: उदाहरणों वाले स्पष्ट prompts, वर्तमान व स्रोत-योग्य तथ्यों के लिए RAG, validation सहित tools, लागत tokens में गिनें। गुणवत्ता: तयशुदा eval set, groundedness, citations सत्यापित करें, तथ्यों के लिए कम temperature। सुरक्षा: prompt injection, न्यूनतम विशेषाधिकार, privacy, bias, मानव अनुमोदन। Deploy: स्मृति = parameters × bytes, quantization, streaming, hosted बनाम open मॉडल।

त्वरित जाँच: मॉडल पिछले हफ़्ते के नीति बदलाव पर ग़लत उत्तर देता है। कौन-सा सुधार सबसे ठीक है?

  • शब्दावली छोटी करें
  • Temperature बढ़ाएँ
  • एक उदाहरण पर fine-tune करें
  • Retrieval जोड़ें ताकि वर्तमान नीति का पाठ prompt में रखा जाए
Answer

Retrieval जोड़ें ताकि वर्तमान नीति का पाठ prompt में रखा जाए — ताज़ा, स्रोत-योग्य तथ्य weights में नहीं, retrieval से prompt में रखे जाते हैं।

त्वरित जाँच: बहुत कम temperature वाला softmax लगभग हर बार वही token क्यों देता है?

  • यह शब्दावली से अन्य tokens हटा देता है
  • यह शीर्ष logit के आसपास वितरण को बहुत तीखा कर देता है
  • यह मॉडल को दोबारा प्रशिक्षित करता है
  • यह और परतें जोड़ता है
Answer

यह शीर्ष logit के आसपास वितरण को बहुत तीखा कर देता है — Logits को छोटी संख्या से भाग देने से अंतर बढ़ते हैं और संभावना केंद्रित हो जाती है।

त्वरित जाँच: Causal mask क्या सुनिश्चित करता है?

  • आउटपुट हमेशा सत्य है
  • कोई स्थिति बाद की स्थितियों की जानकारी उपयोग नहीं कर सकती
  • Prompt छोटा है
  • मॉडल quantized है
Answer

कोई स्थिति बाद की स्थितियों की जानकारी उपयोग नहीं कर सकती — भविष्य के scores ऋण-अनंत होते हैं इसलिए उनके attention weights 0 होते हैं।