CompassPlay: Rewarding the Proposer for Where It Moves the Solver
cs.LG
Submitted: 2026-09-26
Updated: 2026-09-26
Terminology
Sources
- Scaling Self-Play with Self-Guidance
- Self-Evolving Curriculum for LLM Reasoning
- Training Verifiers to Solve Math Word Problems
- STP: Self-play LLM Theorem Provers with Iterative Conjecturing and Proving
- REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization
- R-Zero: Self-Evolving Reasoning LLM from Zero Data
- Qwen2.5-Coder Technical Report
- GASP: Guided Asymmetric Self-Play For Coding LLMs
- Language Self-Play For Data-Free Training
- LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment
- SPICE: Self-Play In Corpus Environments Improves Reasoning
- Teacher-Student Curriculum Learning
- Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL
- DeepSeek-Prover-V2: Advancing Formal Mathematical Reasoning via Reinforcement Learning for Subgoal Decomposition
- Proximal Policy Optimization Algorithms
- Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability
- GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning
- Better LLM Reasoning via Dual-Play
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks