BASIS: Batchwise Advantage Estimation from Single-Rollout Information Sharing for LLM Reasoning
cs.LG, stat.ML
Submitted: 2026-05-26
Updated: 2026-09-15
Comments: 25 pages, 9 figures
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization
- GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning
- Stable Reinforcement Learning for Efficient Reasoning
- What is the objective of reasoning with reinforcement learning?
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning
- EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization
- On-Policy RL with Optimal Reward Baseline
- TIC-GRPO: Provable and Efficient Optimization for Reinforcement Learning from Human Feedback
- REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization
- On the Emergence of Implicit Curriculum in RLVR Learning Dynamics
- Tulu 3: Pushing Frontiers in Open Language Model Post-Training
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- HybridFlow: A Flexible and Efficient RLHF Framework
- ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models
- CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
- Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning
- Fin-R1: A Large Language Model for Financial Reasoning through Reinforcement Learning
- Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks