liu-2023-quadratic-self-attention

OUT premise — summaries/2026/08/24/liu-2023-lost-in-middle-s0-abstract.md

Created 2026-08-25T02:58:08+00:00

Standard transformer self-attention requires memory and compute that grow quadratically (O(n^2)) with sequence length, historically limiting context windows to 512-2048 tokens.