StereoPolicy: Improving Robotic Manipulation Policies via Stereo Perception
cs.RO, cs.CV
Submitted: 2026-05-11
Updated: 2026-09-27
Project page: https://stereopolicy.github.io
Terminology
Sources
- End-to-End Training of Deep Visuomotor Policies
- Reinforcement and Imitation Learning for Diverse Visuomotor Skills
- VIMA: General Robot Manipulation with Multimodal Prompts
- RT-1: Robotics Transformer for Real-World Control at Scale
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Deep Residual Learning for Image Recognition
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- Visual Whole-Body Control for Legged Loco-Manipulation
- HoMeR: Learning In-the-Wild Mobile Manipulation via Hybrid Imitation and Whole-Body Control
- DexPoint: Generalizable Point Cloud Reinforcement Learning for Sim-to-Real Dexterous Manipulation
- FoundationStereo: Zero-Shot Stereo Matching
- A Learned Stereo Depth System for Robotic Manipulation in Homes
- RVT: Robotic View Transformer for 3D Object Manipulation
- 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- TRANSIC: Sim-to-Real Policy Transfer by Learning from Online Correction
- DextrAH-RGB: Visuomotor Policies to Grasp Anything with Dexterous Hands
- DINOv2: Learning Robust Visual Features without Supervision
- Rotary Position Embedding for Vision Transformer
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving