Beyond Visual Quality: A Study of Test-Time Planning with World Action Models
cs.RO
Submitted: 2026-09-21
Updated: 2026-09-21
Terminology
Sources
- Inference-time Physics Alignment of Video Generative Models with Latent World Models
- WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models
- MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models
- RoboWorld: Fast and Reliable Neural Simulators for Generalist Robot Policy Evaluation
- RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation
- From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment
- Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment
- Is the Future Compatible? Diagnosing Dynamic Consistency in World Action Models
- Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation
- ACID: Action Consistency via Inverse Dynamics for Planning with World Models
- $\tau_0$-WM: A Unified Video-Action World Model for Robotic Manipulation
- Qwen3-VL Technical Report
- RynnVLA-002: A Unified Vision-Language-Action and World Model
- World Action Models are Zero-shot Policies
- WorldVLA: Towards Autoregressive Action World Model
- Causal World Modeling for Robot Control
- Visual Foresight: Model-Based Deep Reinforcement Learning for Vision-Based Robotic Control
- HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models
- DynamicWAM: Dual-Path Motion Conditioning for World-Action Models in Dynamic Manipulation
- SelfWAM: A Self-Grounded Unified World Action Model for Fast Robot Control
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving