Video Prediction Policy 2: Predict Better, Act Better
cs.CV, cs.RO
Submitted: 2026-10-07
Updated: 2026-10-08
Project page: https://robert-gyj.github.io/video-prediction-policy-2
Terminology
Sources
- Cosmos World Foundation Model Platform for Physical AI
- Cosmos 3: Omnimodal World Models for Physical AI
- Scalable Behavior Cloning with Open Data, Training, and Evaluation
- Qwen3-VL Technical Report
- Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation
- Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
- AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems
- Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity
- Large Video Planner Enables Generalizable Robot Control
- RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies
- Scaling Egocentric Vision: The EPIC-KITCHENS Dataset
- RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot
- Vidar: Embodied Video Diffusion Model for Generalist Manipulation
- Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
- EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video
- Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models