Universal Pose Pretraining for Generalizable Vision-Language-Action Policies
cs.CV, cs.LG, cs.RO
Submitted: 2026-02-23
Updated: 2026-09-27
Comments: Accepted to Robotics: Science and Systems (RSS) 2026. Project website: https://hetolin.github.io/PoseVLA
Journal ref: Robotics: Science and Systems, 2026
Code: https://github.com/QwenLM/Qwen3-VL
Project page: https://hetolin.github.io/PoseVLA
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Qwen2.5-VL Technical Report
- PaliGemma: A versatile 3B VLM for transfer
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- WorldVLA: Towards Autoregressive Action World Model
- RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
- Training Strategies for Efficient Embodied Reasoning
- Language-Image Models with 3D Understanding
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- VLA-0: Building State-of-the-Art VLAs with Zero Modification
- Seed1.5-VL Technical Report
- Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization
- OpenVLA: An Open-Source Vision-Language-Action Model
- MolmoAct: Action Reasoning Models that can Reason in Space
- Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
- Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
- Flow Matching for Generative Modeling
- HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
- Rectified Flow: A Marginal Preserving Approach to Optimal Transport
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models