Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
cs.LG
Submitted: 2026-08-27
Updated: 2026-08-28
Code: https://github.com/yunpengba7/understanding-es
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Program Synthesis with Large Language Models
- SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training
- Training Verifiers to Solve Math Word Problems
- The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
- The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks
- JustRL: Scaling a 1.5B LLM with a Simple RL Recipe
- Matching Accuracy, Different Geometry: Evolution Strategies vs GRPO in LLM Post-Training
- RL Fine-Tuning Heals OOD Forgetting in SFT
- ESSA: Evolutionary Strategies for Scalable Alignment
- Let's Verify Step by Step
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- Evolution Strategies as a Scalable Alternative to Reinforcement Learning
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- A Survey of On-Policy Distillation for Large Language Models
- ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning
- Mitigating Forgetting Between Supervised and Reinforcement Learning Yields Stronger Reasoners
- Reasoning-CV: Fine-tuning Powerful Reasoning LLMs for Knowledge-Assisted Claim Verification
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks