arxivcs.LGcs.AIcs.CL2026-07-14
Accelerating Masked Diffusion Large Language Models: A Survey of Efficient Inference Techniques
Daehoon Gwak, Minhyung Lee, Junwoo Park, Jaegul Choo
Diffusion large language models (dLLMs) offer a theoretical advantage in parallel generation over standard autoregressive models. However, parallel generation alone does not guarantee practical speedups. Realizing this efficiency requires specialized inference mechanisms, such as…