arxivcs.ROcs.CV2026-07-31
RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation Learning
Qian Wang, Longrui Chen, Peiran Sun, Aleksandar Taranovic, Niklas Freymuth, Ge Li, et al.
Visual imitation learning enables robots to acquire visuomotor skills directly from images, yet RGB observations lack explicit geometric cues, making learned policies brittle to camera perturbations. To address this, we propose \textbf{Ray-conditioned Vision Transformer Encoder (…