arxivcs.AI2026-07-20
Neuro-Symbolic Meta-Policies for Temporal Knowledge-Graph Memory under Partial Observability
Taewoon Kim, Vincent François-Lavet, Michael Cochez
Partially observable reinforcement learning requires deciding what to retain, retrieve, and forget over time. We introduce a neuro-symbolic meta-policy that learns which symbolic memory heuristic to apply at each decision point while keeping execution symbolic. Our setting uses t…