LeWAM: A JEPA World Action Model with Diffusion-Steering-Based MPC
cs.RO, cs.AI, cs.CV
Submitted: 2026-10-08
Updated: 2026-10-08
Terminology
Sources
- Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets
- Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning
- World Action Models are Zero-shot Policies
- Natural Environment Benchmarks for Reinforcement Learning
- The Distracting Control Suite -- A Challenging Benchmark for Reinforcement Learning from Pixels
- LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels
- LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics
- Model-Based Offline Planning
- Steering Your Diffusion Policy with Latent Space Reinforcement Learning
- Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies
- You've Got a Golden Ticket: Improving Generative Robot Policies With A Single Noise Vector
- What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- The CMA Evolution Strategy: A Tutorial
- DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning
- V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- Diffusion Model Predictive Control
- Inference-Time Enhancement of Generative Robot Policies via Predictive World Modeling
- FlowMPC: Improving Flow Matching policies with World Models
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving