arxivcs.LGcs.AIcs.SE2026-07-08
ORCAID: Oblique Rule-Based Continuous-Action Interpretation for Deep RL Policies
Ignacio D. Lopez-Miguel, Ezio Bartocci, Thomas Eiter, Martin Tappler
Explainability remains a key issue in reinforcement learning (RL). Distilling an interpretable policy from an agent trained in a complex environment is particularly challenging when the action space is continuous. We introduce ORCAID, a novel method for extracting interpretable r…