arxivcs.LGcs.AI2026-06-29
Dual-Flow Reinforcement Learning with State-Aware Exploration
Qijun Li, Zheng Fu, Qi Song, Yifei He, Weitao Zhou, Kun Jiang, et al.
In complex continuous-control reinforcement learning tasks, multimodal optimal actions often coincide with uncertain, multimodal return distributions, making reliable value estimation and multimodal exploration challenging. Existing value estimation methods using unimodal Gaussia…