REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning
cs.LG, cs.AI
Submitted: 2026-07-21
Updated: 2026-09-12
Code: https://github.com/yunjie-sysu/REGEN
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- OpenAI o1 System Card
- Distilling the Knowledge in a Neural Network
- MiMo-V2-Flash Technical Report
- MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework
- Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems
- LLMs Can Learn to Reason Via Off-Policy RL
- Efficient RL Training for LLMs with Experience Replay
- Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
- Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs
- Qwen2.5 Technical Report
- Training Verifiers to Solve Math Word Problems
- Evaluating Large Language Models Trained on Code
- Program Synthesis with Large Language Models
- Instruction-Following Evaluation for Large Language Models
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks