Achieving Olympiad-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning
cs.AI
Submitted: 2025-12-11
Updated: 2026-09-04
Terminology
Sources
- ProofNet: Autoformalizing and Formally Proving Undergraduate-Level Mathematics
- Seed-Prover: Deep and Broad Reasoning for Automated Theorem Proving
- Self-Evolving Curriculum for LLM Reasoning
- Gold-medalist Performance in Solving Olympiad Geometry with AlphaGeometry2
- Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use
- Benchmarking the Spectrum of Agent Capabilities
- RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning
- Winning Gold at IMO 2025 with a Model-Agnostic Verification-and-Refinement Pipeline
- START: Self-taught Reasoner with Tools
- ToRL: Scaling Tool-Integrated RL
- Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving
- Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning
- Maximizing Confidence Alone Improves Reasoning
- WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning
- DeepSeek-Prover-V2: Advancing Formal Mathematical Reasoning via Reinforcement Learning for Subgoal Decomposition
- rStar2-Agent: Agentic Reasoning Technical Report
- Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search
- Newclid: A User-Friendly Replacement for AlphaGeometry
- LADDER: Self-Improving LLMs Through Recursive Problem Decomposition
- Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection