Direction-Scale Decomposition in Action Representation: Rethinking What to Tokenize for Vision-Language-Action Models
cs.CV, cs.RO
Submitted: 2026-09-24
Updated: 2026-09-24
Project page: https://vla-dsd.github.io
Terminology
Sources
- RT-1: Robotics Transformer for Real-World Control at Scale
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- FAST: Efficient Action Tokenization for Vision-Language-Action Models
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- ActionCodec: What Makes for Good Action Tokenizers
- Keypoint Action Tokens Enable In-Context Imitation Learning in Robotics
- SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model
- MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models
- LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning
- Evaluating Real-World Robot Manipulation Policies in Simulation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models