arxivcs.LGcs.AI2026-07-07
D2PO: Optimizing Diffusion Samplers via Dynamic Preference
Jinkyu Kim, Jinyoung Choi, Bohyung Han
We propose D2PO (Dynamic Direct Preference Optimization), a principled framework for optimizing diffusion sampling policies with respect to timestep schedules and classifier-free guidance (CFG) weights. Our work is motivated by a fundamental limitation of existing student-teacher…