BIND: Binding 3D Robot Actions to 2D Image Features
cs.RO, cs.CV
Submitted: 2026-09-29
Updated: 2026-09-29
Terminology
Sources
- End-to-End Training of Deep Visuomotor Policies
- Behavioral Cloning from Observation
- One-Shot Imitation Learning
- GELLO: A General, Low-Cost, and Intuitive Teleoperation Framework for Robot Manipulators
- Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- Learning Universal Policies via Text-Guided Video Generation
- Unified Video Action Model
- Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning
- World Action Models are Zero-shot Policies
- Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation
- Coarse-to-Fine Q-attention: Efficient Learning for Visual Robotic Manipulation via Discretisation
- GNFactor: Multi-Task Real Robot Learning with Generalizable Neural Feature Fields
- RVT: Robotic View Transformer for 3D Object Manipulation
- RVT-2: Learning Precise Manipulation from Few Demonstrations
- Transporter Networks: Rearranging the Visual World for Robotic Manipulation
- CLIPort: What and Where Pathways for Robotic Manipulation
- UAD: Unsupervised Affordance Distillation for Generalization in Robotic Manipulation
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving