M cubed P-R1: Reinforcement Learning for Large Language Model Guided Multi-Modal Motion Planning via MIP Code Generation
cs.RO
Submitted: 2026-09-16
Updated: 2026-09-16
Code: https://github.com/XingpengSun0/CoRL-26-M3P-R1
Terminology
Sources
- Do As I Can, Not As I Say: Grounding Language in Robotic Affordances
- LLM+P: Empowering Large Language Models with Optimal Planning Proficiency
- Chain-of-Reasoning: Towards Unified Mathematical Reasoning in Large Language Models via a Multi-Paradigm Perspective
- Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
- Synthesizing mixed-integer linear programming models from natural language descriptions
- OptiMUS: Scalable Optimization Modeling with (MI)LP Solvers and Large Language Models
- ReAct: Synergizing Reasoning and Acting in Language Models
- L3M+P: Lifelong Planning with Large Language Models
- ProgPrompt: Generating Situated Robot Task Plans using Large Language Models
- Text-guided Generation of Efficient Personalized Inspection Plans
- Large Language Models for Supply Chain Optimization
- Evolution of Heuristics: Towards Efficient Automatic Algorithm Design Using Large Language Model
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Solver-Informed RL: Grounding Large Language Models for Authentic Optimization Modeling
- ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
- Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
- Understanding R1-Zero-Like Training: A Critical Perspective
- Learning Cut Selection for Mixed-Integer Linear Programming via Hierarchical Sequence Model
- Ecole: A Gym-like Library for Machine Learning in Combinatorial Optimization Solvers
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving