speculative-decoding-preserves-distribution

IN premiseentries/2026/06/21/wiki-Transformer_deep_learning_architecture-chunk-5.md

Created 2026-06-21T09:55:56+00:00

Speculative decoding uses a small model to generate candidate tokens verified in parallel by the large model, preserving the large model's output distribution via stochastic accept/reject.