ME-Dex 1.0: Bringing Heterogeneous Tactile Sensing into World Action Modeling
cs.CV
Submitted: 2026-09-18
Updated: 2026-09-21
Code: https://github.com/MachEmbodied/ME-Dex-1.0
Project page: https://machembodied.com/ME-Dex/ME-Dex1.0.html
Terminology
Sources
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
- Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets
- World Action Models are Zero-shot Policies
- GigaWorld-Policy: An Efficient Action-Centered World--Action Model
- ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation
- Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization
- OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation
- VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation
- DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo
- ManiFeel: Benchmarking and Understanding Visuotactile Manipulation Policy Learning
- $\tau_0$-WM: A Unified Video-Action World Model for Robotic Manipulation
- Fast-WAM: Do World Action Models Need Test-time Future Imagination?
- Motubrain: An Advanced World Action Model for Robot Control
- T-Rex: Tactile-Reactive Dexterous Manipulation
- Motus2: A Self-Evolving General World Model for Dexterous Manipulation
- Visuo-Tactile World Models
- TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation
- ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation
- Wan: Open and Advanced Large-Scale Video Generative Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models