arxivcs.RO2026-06-30
DVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic Manipulation
Ziyu Shan, Zhenyu Wu, Xiaofeng Wang, Zheng Zhu, Ziwei Wang
Video-based embodied world models provide an appealing substrate for robotic manipulation by predicting future states, yet current approaches remain limited by a fundamental entanglement: accurately modeling dynamics typically requires low-level temporal reasoning, while producin…