Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL
cs.LG, cs.CL
Submitted: 2026-09-30
Updated: 2026-09-30
Code: https://github.com/zhaihaotian/DARA
Terminology
Sources
- L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning
- Group-in-Group Policy Optimization for LLM Agent Training
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models
- Measuring Mathematical Problem Solving With the MATH Dataset
- DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning
- Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
- GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization
- GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
- Understanding R1-Zero-Like Training: A Critical Perspective
- RVPO: Risk-Sensitive Alignment via Variance Regularization
- ToolRL: Reward is All Tool Learning Needs
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation
- Qwen3 Technical Report
- Group Sequence Policy Optimization
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks