पाठ 12 / 27

Layers, Feed-Forward Blocks और Positions

देखें कि attention, MLP, residuals और स्थिति-जानकारी कैसे जुड़ते हैं।

वही block ऊपर-ऊपर

Transformer एक जैसे blocks का ढेर है। हर block में (1) tokens के बीच जानकारी मिलाने को multi-head self-attention, (2) हर token पर अलग से लगने वाला feed-forward network (MLP), (3) block के इनपुट को आउटपुट में वापस जोड़ने वाले residual connections, और (4) स्थिर प्रशिक्षण को normalisation परतें होती हैं। चूँकि अकेला attention क्रम अनदेखा करता है, स्थिति-जानकारी (जैसे rotary position embeddings) जोड़ी जाती है ताकि मॉडल शब्द-क्रम जाने। दर्जनों blocks के ढेर में शुरुआती परतें सरल पैटर्न और बाद की परतें अधिक अमूर्त पैटर्न पकड़ती हैं। अंतिम linear परत शब्दावली पर logits बनाती है।

Block आरेख

नीचे से ऊपर पढ़ें; वही block N बार दोहराया जाता है।

logits over vocabulary
      ^
[ final norm + linear ]
      ^
+-- block x N ------------------+
| x + MultiHeadAttention(norm(x)) |
| x + FeedForward(norm(x))        |
+--------------------------------+
      ^
[ token embeddings + positions ]
      ^
token ids

गहराई और चौड़ाई

मॉडल परतों की संख्या (गहराई), hidden आकार (चौड़ाई) और attention heads में अलग होते हैं। शब्दावली आकार के साथ ये parameter संख्या तय करते हैं।

त्वरित जाँच: Transformer में positions क्यों जोड़ी जाती हैं?

  • शब्दावली घटाने के लिए
  • अकेला attention शब्द-क्रम नहीं जानता
  • Images compress करने के लिए
  • पाठ encrypt करने के लिए
Answer

अकेला attention शब्द-क्रम नहीं जानता — स्थिति-जानकारी के बिना किसी भी क्रम के वही शब्द एक जैसे दिखते हैं।