arxivcs.AI2026-07-12
CRiT-QA: Evaluating Multi-hop Reasoning with Counterfactual Chains and Distractor Traps
JungMin Yun, JuneHyoung Kwon, YoungBin Kim
Evaluating the multi-hop reasoning capabilities of large language models remains a significant challenge. Although current models achieve strong results on existing multi-hop question answering datasets, such performance often masks two critical vulnerabilities: (1) reliance on i…