arxivcs.CLcs.AI2026-07-22
Reinforcement Learning for Large Language Model Selective Evidence Adoption from Contaminated Retrieval Results
Yanyu Chen, Yue Li, Yongyi Cui, Dongsheng Shi, Lichang Dai
Retrieval-augmented large language models frequently face contexts that interleave useful evidence with misleading statements or instruction-like content. Blanket refusal discards valid evidence, whereas uncritical adoption yields incorrect or unsafe answers. The ability to selec…