arxivcs.CRcs.AI2026-07-01
Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces
Junlong Liu, Haobo Wang, Weiqi Luo, Xiaojun Jia
Jailbreak attacks remain a critical threat to the safe deployment of large language models (LLMs). While prior work has primarily studied attacks and defenses at the prompt level, we show that this prompt-centric paradigm overlooks a structural vulnerability in stateful, function…