Boosting LLM Reasoning via Human-Inspired Reward Shaping
cs.LG, cs.AI
Submitted: 2026-02-04
Updated: 2026-09-06
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- The Best of N Worlds: Aligning Reinforcement Learning with Best-of-N Sampling via max@k Optimisation
- Evaluating Large Language Models Trained on Code
- Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Train Long, Think Short: Curriculum Learning for Efficient Reasoning
- Measuring Mathematical Problem Solving With the MATH Dataset
- ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning
- OpenAI o1 System Card
- Risk-Sensitive RL for Alleviating Exploration Dilemmas in Large Language Models
- Rethinking Entropy Regularization in Large Reasoning Models
- CURE: Critical-Token-Guided Re-Concatenation for Entropy-Collapse Prevention
- Learn to Reason Efficiently with Adaptive Length-based Reward Shaping
- Beyond the Sampled Token: Preserving Candidate Support in RLVR
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models
- Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models
- GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
- Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning
- Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks