DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation
cs.RO, cs.AI, cs.CV
Submitted: 2026-09-21
Updated: 2026-09-21
Comments: 22 pages. Project website: https://dextacwam.github.io/
Project page: https://dextacwam.github.io
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- RT-1: Robotics Transformer for Real-World Control at Scale
- Genie: Generative Interactive Environments
- OmniVTLA: Vision-Tactile-Language-Action Models with Semantic-Aligned Tactile Sensing
- World Models
- Mastering Diverse Domains through World Models
- ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation
- Visuo-Tactile World Models
- Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization
- Spatially anchored Tactile Awareness for Robust Dexterous Manipulation
- OpenVLA: An Open-Source Vision-Language-Action Model
- Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation
- Octo: An Open-Source Generalist Robot Policy
- FACT: Failure-Aware Causal Training for World-Action Models
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- The Power of the Senses: Generalizable Manipulation from Vision and Touch through Masked Multimodal Learning
- VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs
- OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving