Uncertainty-Gated Exploration Noise Suppresses Task Collapse in Online RL Fine-Tuning of a Flow-Matching Vision-Language-Action Policy
cs.RO, cs.LG
Submitted: 2026-09-23
Updated: 2026-09-23
Terminology
Sources
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- Exploration by Random Network Distillation
- DIME:Diffusion-Based Maximum Entropy Reinforcement Learning
- Riemannian Walk for Incremental Learning: Understanding Forgetting and Intransigence
- $\pi_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
- Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models
- ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy
- The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
- Adjoint Matching: Fine-tuning Flow and Diffusion Generative Models with Memoryless Stochastic Optimal Control
- Maximum Entropy Reinforcement Learning with Diffusion Policy
- SAFE: Multitask Failure Detection for Vision-Language-Action Models
- Improving Vision-Language-Action Model with Online Reinforcement Learning
- Soft Actor-Critic Algorithms and Applications
- Deep Reinforcement Learning that Matters
- Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning
- VLAConf: Calibrated Task-Success Confidence for Vision-Language-Action Models
- Verifier-free Test-Time Sampling for Vision-Language-Action Models
- SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
- Dual-Flow Reinforcement Learning with State-Aware Exploration
- LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving