# Layers, Feed-Forward Blocks और Positions — Large Language Models

Source: https://www.geekswithgeeks.com/hi/llms/t-architecture

> देखें कि attention, MLP, residuals और स्थिति-जानकारी कैसे जुड़ते हैं।

## वही block ऊपर-ऊपर

Transformer एक जैसे blocks का ढेर है। हर block में (1) tokens के बीच जानकारी मिलाने को **multi-head self-attention**, (2) हर token पर अलग से लगने वाला **feed-forward network (MLP)**, (3) block के इनपुट को आउटपुट में वापस जोड़ने वाले **residual connections**, और (4) स्थिर प्रशिक्षण को **normalisation** परतें होती हैं। चूँकि अकेला attention क्रम अनदेखा करता है, **स्थिति-जानकारी** (जैसे rotary position embeddings) जोड़ी जाती है ताकि मॉडल शब्द-क्रम जाने। दर्जनों blocks के ढेर में शुरुआती परतें सरल पैटर्न और बाद की परतें अधिक अमूर्त पैटर्न पकड़ती हैं। अंतिम linear परत शब्दावली पर logits बनाती है।

## Block आरेख

नीचे से ऊपर पढ़ें; वही block N बार दोहराया जाता है।

```text
logits over vocabulary
      ^
[ final norm + linear ]
      ^
+-- block x N ------------------+
| x + MultiHeadAttention(norm(x)) |
| x + FeedForward(norm(x))        |
+--------------------------------+
      ^
[ token embeddings + positions ]
      ^
token ids
```

## गहराई और चौड़ाई

मॉडल परतों की संख्या (गहराई), hidden आकार (चौड़ाई) और attention heads में अलग होते हैं। शब्दावली आकार के साथ ये parameter संख्या तय करते हैं।

**Quiz:** Transformer में positions क्यों जोड़ी जाती हैं?

- [ ] शब्दावली घटाने के लिए
- [x] अकेला attention शब्द-क्रम नहीं जानता
- [ ] Images compress करने के लिए
- [ ] पाठ encrypt करने के लिए

*Answer:* अकेला attention शब्द-क्रम नहीं जानता. स्थिति-जानकारी के बिना किसी भी क्रम के वही शब्द एक जैसे दिखते हैं।
