arxivcs.CVcs.AIcs.LG2026-07-20
Measuring Monosemanticity in Sparse Autoencoders via Latent Activation Coherence
Katarzyna Filus, Sebastian Pokuciński
Within Explainable Artificial Intelligence, mechanistic interpretability uses Sparse Autoencoders (SAEs) to extract more interpretable features from neural representations. However, assessing their monosemanticity, and thus explanation quality, remains challenging. Existing metri…