EmboAlign: Aligning Video Generation with Compositional Constraints for Zero-Shot Manipulation
cs.RO
Submitted: 2026-03-05
Updated: 2026-09-16
Terminology
Sources
- Large Video Planner Enables Generalizable Robot Control
- Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations
- CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL
- VideoAgent: Self-Improving Video Generation
- Dream2Flow: Bridging Video Generation and Open-World Manipulation with 3D Object Flow
- Robot Learning from a Physical World Model
- Video as the New Language for Real-World Decision Making
- Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation
- Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion
- DreamGen: Unlocking Generalization in Robot Learning through Video World Models
- NovaFlow: Zero-Shot Manipulation via Actionable Flow from Generated Videos
- Spatiotemporal Predictive Pre-training for Robotic Motor Control
- Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations
- Unified Video Action Model
- RoboDreamer: Learning Compositional World Models for Robot Imagination
- Grounding Generated Videos in Feasible Plans via World Models
- Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection
- SafeBimanual: Diffusion-based Trajectory Optimization for Safe Bimanual Manipulation
- Empowering Autonomous Driving with Large Language Models: A Safety Perspective
- SENTINEL: A Multi-Level Formal Framework for Safety Evaluation of Foundation Model-based Embodied Agents
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving