CORTEXA
← Browse

Jianqiang Xia

1 paper indexed

arxivcs.LGcs.CL2026-07-13

SCOPE-RL: Optimizing Reasoning Paths Before and After Success

Xiaojian Liu, Han Xu, Jianqiang Xia, Zhixuan Li, Ke Xu, Yiwei Dai, et al.

Reinforcement learning with verifiable rewards (RLVR) optimizes LLMs using sparse verifiable final-answer rewards. This sparse anchor reliably verifies whether a trajectory succeeds but provides no direct feedback on the reasoning path that produced it. Before success, prerequisi…

View free PDFSource page