liu-2023-quadratic-self-attention
OUT premise — summaries/2026/08/24/liu-2023-lost-in-middle-s0-abstract.md
Created 2026-08-25T02:58:08+00:00
Standard transformer self-attention requires memory and compute that grow quadratically (O(n^2)) with sequence length, historically limiting context windows to 512-2048 tokens.