arxivcs.LGcs.AI2026-07-18
Beyond Memory Leaderboards: Evaluating Scientific Memory as Budgeted Context Restoration
Maksim Sheverev, David Finkelstein, Sergey Nikolenko
Long-term memory is becoming a core component of LLM agents, but most memory benchmarks evaluate conversations or compact summaries, while research agents need to restore evidence from full scientific papers. We introduce two full-text scientific-memory benchmarks, Public AI Memo…