speculative-decoding-preserves-distribution
IN premise — entries/2026/06/21/wiki-Transformer_deep_learning_architecture-chunk-5.md
Created 2026-06-21T09:55:56+00:00
Speculative decoding uses a small model to generate candidate tokens verified in parallel by the large model, preserving the large model's output distribution via stochastic accept/reject.