RobotAPO: Adversarial Physics Preference Optimization for Robotic Manipulation Video Generation
cs.RO
Submitted: 2026-10-07
Updated: 2026-10-07
Terminology
Sources
- Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models
- Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation
- Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models
- Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
- AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems
- GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation
- Large Video Planner Enables Generalizable Robot Control
- RealDPO: Real or Not Real, that is the Preference
- Discriminator-Free Direct Preference Optimization for Video Diffusion
- WoW: Towards a World omniscient World model Through Embodied Interaction
- EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer
- Vidar: Embodied Video Diffusion Model for Generalist Manipulation
- VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation
- VideoScore2: Think before You Score in Generative Video Evaluation
- CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers
- Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations
- D-Fusion: Direct Preference Optimization for Aligning Diffusion Models with Visually Consistent Samples
- OpenVLA: An Open-Source Vision-Language-Action Model
- Learning to Act from Actionless Videos through Dense Correspondences
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving