WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory and In-Context Learning
cs.RO
Submitted: 2026-07-21
Updated: 2026-09-20
Project page: https://manifoldai-research.github.io/WorldScape-Policy
Terminology
Sources
- WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models
- ${\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
- Fast-WAM: Do World Action Models Need Test-time Future Imagination?
- Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising
- GigaWorld-Policy: An Efficient Action-Centered World--Action Model
- World Action Models are Zero-shot Policies
- MemoryWAM: Efficient World Action Modeling with Persistent Memory
- Vidar: Embodied Video Diffusion Model for Generalist Manipulation
- TSI: Temporal Saliency Integration for Video Action Recognition
- Discovering A Variety of Objects in Spatio-Temporal Human-Object Interactions
- Collaborative Distillation in the Parameter and Spectrum Domains for Video Action Recognition
- DriveMamba: Task-Centric Scalable State Space Model for Efficient End-to-End Autonomous Driving
- V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
- GigaWorld-0: World Models as Data Engine to Empower Embodied AI
- OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation
- MEM: Multi-Scale Embodied Memory for Vision Language Action Models
- Long-Horizon Manipulation via Trace-Conditioned VLA Planning
- Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection
- DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation
- NovaPlan: Zero-Shot Long-Horizon Manipulation via Closed-Loop Video Language Planning
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving