transformer-pre-ln-vs-post-ln
IN premise — entries/2026/06/21/wiki-Transformer_deep_learning_architecture-chunk-1.md
Created 2026-06-21T09:55:54+00:00
The original 2017 transformer used post-layer-normalization; many modern implementations use pre-layer-normalization for more stable training.