GeomVLA: Unifying Scene, Motion, and Action in 3D
cs.RO
Submitted: 2026-09-12
Updated: 2026-09-15
Terminology
Sources
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- PaliGemma: A versatile 3B VLM for transfer
- Qwen2.5 Technical Report
- FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies
- 3D Diffuser Actor: Policy Diffusion with 3D Scene Representations
- RVT: Robotic View Transformer for 3D Object Manipulation
- 3D-VLA: A 3D Vision-Language-Action Generative World Model
- SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model
- 4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
- Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation
- PointVLA: Injecting the 3D World into Vision-Language-Action Models
- WorldVLA: Towards Autoregressive Action World Model
- FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
- TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies
- TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos
- RoboFlow4D: A Lightweight Flow World Model Toward Real-Time Flow-Guided Robotic Manipulation
- RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
- Learning Robotic Manipulation Policies from Point Clouds with Conditional Flow Matching
- PerAct2: Benchmarking and Learning for Robotic Bimanual Manipulation Tasks
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving