CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
cs.CV, cs.AI
Submitted: 2026-04-27
Updated: 2026-09-04
Code: https://github.com/EmbodiedAI-RoboTron/CF-VLA
Terminology
Sources
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- UniVLA: Learning to Act Anywhere with Task-centric Latent Actions
- Neural Ordinary Differential Equations
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- EveryDayVLA: A Vision-Language-Action Model for Affordable Robotic Manipulation
- Diffusion Trajectory-guided Policy for Long-horizon Robot Manipulation
- Diffusion Transformer Policy
- LaDi-WM: A Latent Diffusion-based World Model for Predictive Manipulation
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- Incorporating Task Progress Knowledge for Subgoal Generation in Robotic Manipulation through Image Edits
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
- Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning
- OpenVLA: An Open-Source Vision-Language-Action Model
- MolmoAct: Action Reasoning Models that can Reason in Space
- Motion Manifold Flow Primitives for Task-Conditioned Trajectory Generation under Complex Task-Motion Dependencies
- CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
- Flow Matching for Generative Modeling
- LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning
- RoboUniView: Visual-Language Model with Unified View Representation for Robotic Manipulation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models