arxiveess.SY2026-06-27
Divergence-based Safety Measure for Large Language Models via Rational Inattention
This paper proposes a divergence-based safety measure for large language models (LLMs) under embedding-input attacks. The proposed measure quantifies the worst-case Kullback--Leibler divergence between the clean and attacked LLMs' output distributions, subject to a stealthiness c…