arxivcs.AI2026-07-06
Diffusion-Guided Uncertainty-Aware Delayed Policy Optimization
Junqi Tu, Zejiao Liu, Fangfei Li, Yang Tang
Reinforcement learning in real world environments often suffers from severe performance degradation due to delayed feedback. Existing approaches typically mitigate performance degradation caused by observation delays by constructing augmented states or predicting the true states.…