H-VLA: Hierarchical Vision-Language-Action Model with Key-Action Reasoning and Motion Planning in a Unified Action Space

arXiv:2609.22895 · cs.RO · Submitted 2026-09-19 · Read on arXiv

cs.RO

Submitted: 2026-09-19

Updated: 2026-09-19

Terminology

Sources

Related papers