encoder-2-sublayers-decoder-3-sublayers

IN premiseentries/2026/06/21/wiki-Transformer_deep_learning_architecture-chunk-4.md

Created 2026-06-21T09:55:55+00:00

Each encoder layer has 2 sublayers (self-attention, FFN); each decoder layer has 3 sublayers (masked self-attention, cross-attention, FFN).