LLMs as Adaptive Meta-Solvers: Strategy-Diverse RL for Industrial-Scale Optimization
cs.LG, cs.CL
Submitted: 2026-09-28
Updated: 2026-09-28
Terminology
Sources
- OptiMUS: Scalable Optimization Modeling with (MI)LP Solvers and Large Language Models
- Autoformulation of Mathematical Optimization Models Using LLMs
- Leveraging Large Language Models to Develop Heuristics for Emerging Optimization Problems
- OPT-Engine: Benchmarking the Limits of LLMs in Optimization Modeling via Complexity Scaling
- The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
- Opti-Agent-Bench: Benchmarking End-to-End Optimization R&D Agents on Real-World Business Problems
- Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs
- FrontierOR: Benchmarking LLMs' Capacity for Efficient Algorithm Design in Large-Scale Optimization
- Constructing Industrial-Scale Optimization Modeling Benchmark
- Diverse Thinking Schemata Elicit Better Reasoning in Large Language Models
- Evolution of Heuristics: Towards Efficient Automatic Algorithm Design Using Large Language Model
- Opt-Verifier: Unleashing the Power of LLMs for Optimization Modeling via Dual-Side Verification
- Automated Optimization Modeling via a Localizable Error-Driven Perspective
- OptMATH: A Scalable Bidirectional Data Synthesis Framework for Optimization Modeling
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- HybridFlow: A Flexible and Efficient RLHF Framework
- CALM Before the STORM: Unlocking Native Reasoning for Optimization Modeling
- Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies
- Formalize, Don't Optimize: The Heuristic Trap in LLM-Generated Combinatorial Solvers
- Step-Opt: Boosting Optimization Modeling in LLMs through Iterative Data Synthesis and Structured Validation
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks