MatrixReward: Reward from Rubric Matrix for Open-Ended Generation
cs.LG, cs.AI, stat.ML
Submitted: 2026-09-30
Updated: 2026-09-30
Code: https://github.com/Backsingles/MatrixReward
Terminology
Sources
- GOPO: Policy Optimization using Ranked Rewards
- UltraFeedback: Boosting Language Models with Scaled AI Feedback
- Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators
- SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models
- Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric
- From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline
- GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization
- GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
- Understanding R1-Zero-Like Training: A Critical Perspective
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Pairwise or Pointwise? Evaluating Feedback Protocols for Bias in LLM-Based Evaluation
- Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR
- RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction
- DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
- Qwen3 Technical Report
- Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
- Uncovering and Mitigating Aggregation-Induced Reward Hacking in Multi-Reward Reinforcement Learning
- ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks