arxivcs.LGcs.AIcs.CR2026-07-02
kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail
Mahmoud Abdelfattah, Hamid Nasiri, Peter Garraghan
Large language models (LLMs) are increasingly deployed in domains requiring guardrails to detect unsafe, off-topic, or adversarial prompts. Existing guardrails predominantly rely on fine-tuning to build classifiers, which often suffer from low generalization and high inference la…