arxivcs.CVcs.RO2026-07-06
Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies
Adrian Szvoren, Dimitrios Kanoulas, Nilufer Tuptuk
Vision-language-action (VLA) models enable robot navigation from natural language and visual goals, but remain susceptible to perceptual distractions and ambiguous scene interpretations. This paper presents the first empirical evaluation of visual grounding for VLA navigation pol…