Find Something You Can't Do: Agentic Real-World Reinforcement Learning for Self-Improving VLA Models
cs.RO
Submitted: 2026-09-25
Updated: 2026-10-01
Code: https://github.com/huggingface/lerobot
Terminology
Sources
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- Self-Improving Robots: End-to-End Autonomous Visuomotor Reinforcement Learning
- ASPIRE: Agentic /Skills Discovery for Robotics
- Residual Off-Policy RL for Finetuning Behavior Cloning Policies
- RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning
- RL Token: Bootstrapping Online RL with Vision-Language-Action Models
- When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning
- Practice Makes Perfect: Planning to Learn Skill Parameter Policies
- Demonstration-Bootstrapped Autonomous Practicing via Multi-Task Reinforcement Learning
- Robot Trains Robot: Automatic Real-World Policy Adaptation and Learning for Humanoids
- Inner Monologue: Embodied Reasoning through Planning with Language Models
- PaLM-E: An Embodied Multimodal Language Model
- VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models
- Language to Rewards for Robotic Skill Synthesis
- Robots That Ask For Help: Uncertainty Alignment for Large Language Model Planners
- HARBOR: A Harness Framework for Agentic Robot Reinforcement Learning
- Nautilus: From One Prompt to Plug-and-Play Robot Learning
- Randomized Ensembled Double Q-Learning: Learning Fast Without a Model
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving