Cooperative Multi-Agent Vision-Language-Action Models via Reinforced Fine Tuning
cs.RO, cs.AI, cs.MA
Submitted: 2026-09-29
Updated: 2026-09-29
Terminology
Sources
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- WorldVLA: Towards Autoregressive Action World Model
- EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents
- $\pi_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
- RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
- ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy
- TGRPO :Fine-tuning Vision-Language-Action Model via Trajectory-wise Group Relative Policy Optimization
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models
- CHORUS: Decentralized Multi-Embodiment Collaboration with One VLA Policy
- Improving Vision-Language-Action Model with Online Reinforcement Learning
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment
- OpenVLA: An Open-Source Vision-Language-Action Model
- SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
- HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
- COHERENT: Collaboration of Heterogeneous Multi-Robot System with Large Language Models
- Rectified Flow: A Marginal Preserving Approach to Optimal Transport
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving