Train Together or Merge Later? Unifying VLA Experts via a Shared Action Interface
cs.CV, cs.RO
Submitted: 2026-09-27
Updated: 2026-09-27
Project page: https://policyweave.github.io
Terminology
Sources
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models
- $\pi_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
- DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization
- Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning
- CORAL: Scalable Multi-Task Robot Learning via LoRA Experts
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models
- Expertise need not monopolize: Action-Specialized Mixture of Experts for Vision-Language-Action Learning
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- Merging Multi-Task Models via Weight-Ensembling Mixture of Experts
- Q-VGM: Q-Guided Value-Gradient Matching for Offline-to-Online RL of Flow-Matching VLA Policies
- Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA
- CRL-VLA: Continual Vision-Language-Action Learning
- MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models