CataOPD: Catalytic On-Policy Distillation for Large Language Model Reasoning
cs.LG, cs.CE
Submitted: 2026-08-25
Updated: 2026-08-25
Code: https://github.com/QwenQKing/CataOPD
Terminology
Sources
- Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models
- HDPO: Hybrid Distillation Policy Optimization via Privileged Self-Distillation
- Agentic Reinforced Policy Optimization
- Rubric-based On-policy Distillation
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision
- DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
- Measuring Mathematical Problem Solving With the MATH Dataset
- Reinforcement Learning via Self-Distillation
- Explain in Your Own Words: Improving Reasoning via Token-Selective Dual Knowledge Distillation
- DistiLLM-2: A Contrastive Approach Boosts the Distillation of LLMs
- DemoPSD: Disagreement-Modulated Policy Self-Distillation
- When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
- Understanding R1-Zero-Like Training: A Critical Perspective
- Orca-Math: Unlocking the potential of SLMs in Grade School Math
- AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset
- RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation
- Privileged Information Distillation for Language Models
- OpenAI GPT-5 System Card
- Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks