vit-16x16-patches-as-tokens

IN premiseentries/2026/06/21/wiki-Transformer_deep_learning_architecture-chunk-7.md

Created 2026-06-21T09:55:55+00:00

Vision Transformer (ViT) by Dosovitskiy et al. (2021) divides images into 16x16 patches treated as tokens for image recognition