arxivcs.CVcs.AI2026-07-23
HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving
Quanfu Yu, Xian Wu, Hao Xu, Liulong Ma
Vision-Language-Action (VLA) models augmented with world modeling represent a promising paradigm for end-to-end autonomous driving. While pixel-level future prediction enables fine-grained spatiotemporal reasoning, it compromises robustness in noisy driving scenarios. Conversely,…