CriPO: Enhancing Rubric-based RL via Self-Distillation
cs.LG, cs.AI
Submitted: 2026-07-20
Updated: 2026-09-27
Code: https://github.com/lasgroup/SDPO
Terminology
Sources
- HealthBench: Evaluating Large Language Models Towards Improved Human Health
- RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
- A Survey on LLM-as-a-Judge
- Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation
- Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
- Reinforcement Learning via Self-Distillation
- Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR
- Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?
- Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy
- Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
- Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
- Self-Distilled Policy Gradient
- Self-Distilled Agentic Reinforcement Learning
- The Reasoning Boundary Paradox: How Reinforcement Learning Constrains Language Models
- GPT-4 Technical Report
- RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation
- Rubric-Guided Self-Distillation: Post-Training Without Rubric Verifiers
- Proximal Policy Optimization Algorithms
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks