arxivcs.LG2026-07-09
Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels
Hua Qu, Yifan Li, Xiaodong Yuan
Direct Preference Optimization (DPO) has become an important method for aligning large language models (LLMs) with human preferences because it removes the need for explicit reward modeling and reinforcement learning. However, its performance depends heavily on the quality of pre…