Disentangling Optimization Scale from Preference Scale in DPO
cs.LG
Submitted: 2026-08-27
Updated: 2026-08-27
Code: https://github.com/ivankru/bayesian_dpo
Terminology
Sources
- A General Theoretical Paradigm to Understand Learning from Human Preferences
- Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback
- Bootstrapping Language Models with DPO Implicit Rewards
- Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators
- KTO: Model Alignment as Prospect Theoretic Optimization
- Geometric-Averaged Preference Optimization for Soft Preference Labels
- Explicit Preference Optimization: No Need for an Implicit Reward Model
- ROPO: Robust Preference Optimization for Large Language Models
- Gradient Imbalance in Direct Preference Optimization
- Distributional Preference Alignment of LLMs via Optimal Transport
- SimPO: Simple Preference Optimization with a Reference-Free Reward
- Entropy Controllable Direct Preference Optimization
- Direct Preference Optimization: Your Language Model is Secretly a Reward Model
- Provably Robust DPO: Aligning Language Models with Noisy Feedback
- Towards Data-Centric RLHF: Simple Metrics for Preference Dataset Comparison
- Efficiently Training Low-Curvature Neural Networks
- Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives
- Direct Preference Optimization with Rating Information: Practical Algorithms and Provable Gains
- Secrets of RLHF in Large Language Models Part II: Reward Modeling
- HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks