decision-transformer-rl-as-sequence-modeling
IN premise — entries/2026/06/21/wiki-Transformer_deep_learning_architecture-chunk-6.md
Created 2026-06-21T09:50:11+00:00
Decision Transformer (Chen et al., 2021) recasts reinforcement learning as sequence modeling, applying the Transformer architecture to RL problems.
Summary
Instead of building specialized algorithms for trial-and-error learning, you can treat the whole problem as "predict the next item in a sequence" and let a standard transformer model (the same architecture behind large language models) handle it. This matters because it lets reinforcement learning piggyback on the massive scaling, training, and inference infrastructure already built for sequence models, removing the need for bespoke RL machinery and making it easier to condition on desired outcomes rather than hand-engineered reward functions.
Dependents
These beliefs depend on this one:
- OUT decision-transformer-validates-rl-subsumed-by-sequence-modeling — Decision Transformer's successful recasting of reinforcement learning as autoregressive sequence modeling validates that the transformer's next-token prediction objective can subsume entire computational paradigms, reducing RL problems to the same sequence completion framework underlying all language modeling.
- IN transformer-architecture-generalizes-beyond-nlp — The Transformer architecture demonstrates domain generality far beyond NLP — solving protein structure prediction (AlphaFold), playing grandmaster-level chess without search, and recasting reinforcement learning as sequence modeling (Decision Transformer) — revealing it as a general-purpose sequence processing architecture rather than a language-specific one.