arxivcs.CVcs.RO2026-06-28
Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model
Jiaxin Liu, Xun Xu, Zhenhao Zhang, Hanqing Wang, Ruiqi Chen, Shi Chang, et al.
Vision-Language-Action (VLA) models have become an important paradigm of embodied AI. However, existing VLA models typically assume well-lit and stable indoor settings, while real-world embodied manipulation may involve degraded RGB observations caused by illumination shifts, pos…