arxivcs.SEcs.CRcs.LG2026-06-30
An Empirical Study of Security Calibration in Large Language Models for Code
Mohammed Latif Siddiq, Md. Nafiu Rahman, Joanna C. S. Santos
Large Language Models (LLMs) are rapidly transforming software development, yet their use in security-critical contexts raises a key question: do models know when their generated code is insecure? This property, known as calibration, measures whether a model's confidence aligns w…