Unified Visual-Tactile-Action Modeling from Human Demonstrations for Dexterous Manipulation
cs.RO, cs.AI
Submitted: 2026-09-28
Updated: 2026-09-29
Project page: https://uni-vta.github.io
Terminology
Sources
- Tactile Dexterity: Manipulation Primitives with Tactile Feedback
- See to Touch: Learning Tactile Dexterity through Visual Incentives
- DexTac: Learning Contact-aware Visuotactile Policies via Hand-by-hand Teaching
- T-Rex: Tactile-Reactive Dexterous Manipulation
- Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation
- Ego4D: Around the World in 3,000 Hours of Egocentric Video
- HOI4D: A 4D Egocentric Dataset for Category-Level Human-Object Interaction
- Masked Visual Pre-training for Motor Control
- R3M: A Universal Visual Representation for Robot Manipulation
- MimicPlay: Long-Horizon Imitation Learning by Watching Human Play
- DexMV: Imitation Learning for Dexterous Manipulation from Human Videos
- DexCap: Scalable and Portable Mocap Data Collection System for Dexterous Manipulation
- EgoMimic: Scaling Imitation Learning via Egocentric Video
- DexImit: Learning Bimanual Dexterous Manipulation from Monocular Human Videos
- EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos
- EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data
- Learning Universal Policies via Text-Guided Video Generation
- Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation
- RoboDreamer: Learning Compositional World Models for Robot Imagination
- Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving