VT-MUSE: Multimodal Unified Sequential Visuotactile Representation Learning for Manipulation
cs.RO, cs.CV
Submitted: 2026-08-21
Updated: 2026-10-06
Terminology
Sources
- FAWAM: Force-Aware World Action Models for Closed-Loop Contact-Rich Manipulation
- Sparsh: Self-supervised touch representations for vision-based tactile sensing
- Transferable Tactile Transformers for Representation Learning Across Diverse Sensors and Tasks
- Visuo-Tactile Transformers for Manipulation
- ViTaMIn: Learning Contact-Rich Tasks Through Robot-Free Visuo-Tactile Manipulation Interface
- ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation
- OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation
- ManiSkill-ViTac 2025: Challenge on Manipulation Skill Learning With Vision and Tactile Sensing
- ManiFeel: Benchmarking and Understanding Visuotactile Manipulation Policy Learning
- UniVTAC: A Unified Simulation Platform for Visuo-Tactile Manipulation Data Generation, Learning, and Benchmarking
- TacO: Benchmarking Tactile Sensors for Object Manipulation
- Tabero: Learning Gentle Manipulation with Closed-Loop Force Feedback from Vision, Touch, and Language
- TactiDex: A Real-World Tactile-Guided Benchmark for Human-Like Dexterous Manipulation
- $N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens
- UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation
- FreeTacMan: Robot-free Visuo-Tactile Data Collection System for Contact-rich Manipulation
- Touch begins where vision ends: Generalizable policies for contact-rich manipulation
- Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation
- Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention
- TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving