Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation
cs.LG, cs.AI
Submitted: 2026-04-14
Updated: 2026-09-26
Code: https://github.com/jet-ai-projects/Lightning-OPD
Terminology
Sources
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- OpenAI GPT-5 System Card
- Kimi K2.5: Visual Agentic Intelligence
- NVIDIA Nemotron 3: Efficient and Open Intelligence
- MiMo-V2-Flash Technical Report
- OpenThoughts: Data Recipes for Reasoning Models
- Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
- Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
- Self-Distillation Enables Continual Learning
- Reinforcement Learning via Self-Distillation
- A Survey of On-Policy Distillation for Large Language Models
- Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
- Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
- Entropy-Aware On-Policy Distillation of Language Models
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- DAPO: An Open-Source LLM Reinforcement Learning System at Scale
- Qwen3 Technical Report
- Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
- RL's Razor: Why Online Reinforcement Learning Forgets Less
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks