loo-regression-estimates-unembedding-representation

IN premise — summaries/2026/08/24/park-2023-linear-representation-s14-the-prince-matured-and-eventually-became-the.md

Created 2026-08-24T17:11:02+00:00

The unembedding representation used for computing causal inner products in Park et al. (2023) is estimated via a Leave-One-Out (LOO) regression procedure, connecting to broader methodology for recovering internal representations without white-box access.

Summary

Researchers at Park et al. (2023) used a statistical estimation trick—training a small regression model while leaving out one observation at a time—to reverse-engineer how a transformer's final output layer maps internal states to text, letting them measure causal influence between token positions without needing to inspect the model's actual weights. This matters because it shows you can recover meaningful internal structure from outside-in probing, connecting a specific circuit-discovery method to a broader family of techniques for reading a model's inner logic without full architectural access.