GroupDPO: Memory-Efficient Group-Wise Direct Preference Optimization
cs.CL
Submitted: 2026-04-17
Updated: 2026-09-01
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- The Llama 3 Herd of Models
- Multi-Preference Optimization: Generalizing DPO via Set-Level Contrasts
- Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs
- LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
- gpt-oss-120b & gpt-oss-20b Model Card
- Tulu 3: Pushing Frontiers in Open Language Model Post-Training
- Taming Overconfidence in LLMs: Reward Calibration in RLHF
- Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
- UltraFeedback: Boosting Language Models with Scaled AI Feedback
- RankGR: Rank-Enhanced Generative Retrieval with Listwise Direct Preference Optimization in Recommendation
- ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning
- Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
- Generalizing Verifiable Instruction Following
- Length Desensitization in Direct Preference Optimization
- Proximal Policy Optimization Algorithms
- Decoupled Weight Decay Regularization
- Olmo 3
- Gemma 3 Technical Report
- Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive
- Qwen3 Technical Report
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering