Future Policy Approximation for Offline Reinforcement Learning Improves Mathematical Reasoning
Minjae Oh, Yunho Choi, Dongmin Choi, Yohan Jo
cs.CL
Submitted: 2026-08-19
Updated: 2026-08-20
Code: https://github.com/huggingface/trl
Terminology
Sources
- MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention
- Training Verifiers to Solve Math Word Problems
- On Group Relative Policy Optimization Collapse in Agent Search: The Lazy Likelihood-Displacement
- The Llama 3 Herd of Models
- Reinforced Self-Training (ReST) for Language Modeling
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Direct Language Model Alignment from Online AI Feedback
- OpenAI o1 System Card
- The Art of Scaling Reinforcement Learning Compute for LLMs
- Efficient Memory Management for Large Language Model Serving with PagedAttention
- Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
- Tulu 3: Pushing Frontiers in Open Language Model Post-Training
- EXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modes
- EXAONE Deep: Reasoning Enhanced Language Models
- PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning
- Training language models to follow instructions with human feedback
- Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive
- Trust Region Policy Optimization
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering