transformer-original-100m-params
IN premise — entries/2026/06/21/wiki-Transformer_deep_learning_architecture-chunk-2.md
Created 2026-06-21T09:55:55+00:00
The original transformer was a 100M-parameter encoder-decoder model.
IN premise — entries/2026/06/21/wiki-Transformer_deep_learning_architecture-chunk-2.md
Created 2026-06-21T09:55:55+00:00
The original transformer was a 100M-parameter encoder-decoder model.