Do World Models Make Better Robots? A Survey of Evaluation Benchmarks for Predictive Embodied Intelligence
cs.RO, cs.AI
Submitted: 2026-08-30
Updated: 2026-08-30
Terminology
Sources
- ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks
- BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation
- CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks
- Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- ManiSkill2: A Unified Benchmark for Generalizable Manipulation Skills
- Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots
- LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning
- VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks
- Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots
- EVA: An Embodied World Model for Future Video Anticipation
- EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models
- Do generative video models understand physical principles?
- Physion: Evaluating Physical Prediction from Vision in Humans and Machines
- Physion++: Evaluating Physical Scene Understanding that Requires Online Inference of Different Physical Properties
- VideoPhy: Evaluating Physical Commonsense for Video Generation
- WorldModelBench: Judging Video Generation Models As World Models
- WorldScore: A Unified Evaluation Benchmark for World Generation
- VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness
- WorldPrediction: A Benchmark for High-level World Modeling and Long-horizon Procedural Planning
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving