Many Ways to Succeed: Diversity-Driven RL Fine-Tuning for VLA Generalization
cs.RO, cs.LG
Submitted: 2026-10-07
Updated: 2026-10-07
Terminology
Sources
- Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models
- $\pi_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
- RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
- LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
- Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process
- $\pi^{*}_{0.6}$: a VLA That Learns From Experience
- ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning
- VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning
- SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model
- Proximal Policy Optimization Algorithms
- Interactive Post-Training for Vision-Language-Action Models
- Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models
- RESample: A Robust Data Augmentation Framework via Exploratory Sampling for Robotic Manipulation
- Discover, Learn, and Reinforce: Scaling Vision-Language-Action Pretraining with Diverse RL-Generated Trajectories
- Robotic Control via Embodied Chain-of-Thought Reasoning
- Do World Action Models Generalize Better than VLAs? A Robustness Study
- Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving