What to Attend, What to Keep: Skill-Conditioned Visuotactile Representation with Progress-Guided Event Memory
cs.RO, cs.CV
Submitted: 2026-09-29
Updated: 2026-09-29
Project page: http://what-to-attend-what-to-keep.github.io
Terminology
Sources
- Visuo-Tactile Transformers for Manipulation
- OmniVTLA: Vision-Tactile-Language-Action Models with Semantic-Aligned Tactile Sensing
- Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots
- Sparsh: Self-supervised touch representations for vision-based tactile sensing
- 3D-ViTac: Learning Fine-Grained Manipulation with Visuo-Tactile Sensing
- Making Sense of Vision and Touch: Learning Multimodal Representations for Contact-Rich Tasks
- See, Hear, and Feel: Smart Sensory Fusion for Robotic Manipulation
- Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons
- VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training
- Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models
- EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies
- DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI
- KEMO: Event-Driven Keyframe Memory for Long-Horizon Robot Manipulation with VLA Policies
- ReWiND: Language-Guided Rewards Teach Robot Policies without New Demonstrations
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving