arxivcs.CV2026-07-10
Subtoken Vision Transformer for Fine-grained Recognition
Jie Zhu, Ivy Zhang, Minchul Kim, Xiaoming Liu
We present Subtoken Vision Transformer (SubViT), a selective image tokenization method for fine-grained visual recognition. Standard Vision Transformers compress each fixed-size patch into a single token, although fine-grained distinctions often depend on localized variations wit…