CORTEXA
← Browse

Lovedeep Gondara

1 paper indexed

arxivcs.LG2026-07-06

A Coin Flip Per Token: Bernoulli Sparse Steering of Large Language Models

Nima Eshraghi, Lovedeep Gondara, Yuqing Huang, Sagarika Suresh, Leizer Teran, Jithin Pradeep, et al.

Activation steering via sparse autoencoders (SAEs) enables behavioral control of large language models without task-specific fine-tuning, but standard methods apply the steering signal at every generated token, incurring constant per-token perturbation that risks degrading fluenc…

View free PDFSource page