SLIP-VLA: Single-Step Latent Imagination for Policy Learning in Vision-Language-Action Models
cs.RO
Submitted: 2026-09-27
Updated: 2026-09-27
Terminology
Sources
- OpenVLA: An Open-Source Vision-Language-Action Model
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- WorldVLA: Towards Autoregressive Action World Model
- FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
- Motubrain: An Advanced World Action Model for Robot Control
- Causal World Modeling for Robot Control
- World Action Models are Zero-shot Policies
- Geometric Action Model for Robot Policy Learning
- AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding
- Learning Transferable Dynamics Priors from Action to World Modeling
- LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels
- Scaling World Model for Hierarchical Manipulation Policies
- StreamVLA: Breaking the Reason-Act Cycle via Completion-State Gating
- ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation
- mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs
- Fast-WAM: Do World Action Models Need Test-time Future Imagination?
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving