arxivcs.LGcs.AI2026-07-06
RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents
Qiang Liu, Taian Guo, Ruizhi Qiao, Xing Sun
Reinforcement learning holds significant potential for training large language models (LLMs) to handle multi-turn interactive tasks. However, in long-horizon, multi-turn tasks characterized by sparse outcome rewards, directly training with outcome rewards often results in slow co…