CORTEXA
← Browse

Qi Song

1 paper indexed

arxivcs.LGcs.AI2026-06-29

Dual-Flow Reinforcement Learning with State-Aware Exploration

Qijun Li, Zheng Fu, Qi Song, Yifei He, Weitao Zhou, Kun Jiang, et al.

In complex continuous-control reinforcement learning tasks, multimodal optimal actions often coincide with uncertain, multimodal return distributions, making reliable value estimation and multimodal exploration challenging. Existing value estimation methods using unimodal Gaussia…

View free PDFSource page