PanoFuse: Panorama-Enhanced Vision-Language-Action Learning with Decoupled Semantic-Geometric Routing
cs.CV, cs.RO, eess.IV
Submitted: 2026-09-21
Updated: 2026-09-21
Project page: https://xux-hnu.github.io/PanoFuse
Terminology
Sources
- Learning Panorama-Aware VLA for Mobile Manipulation with Whole-Body Teleoperation
- DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
- Multi-View Unified Camera Fields: Geometry-Shaped Action-Facing Representations for RGB-Only Multi-Camera VLA Policies
- AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models
- Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models
- VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
- TGM-VLA: Task-Guided Mixup for Sampling-Efficient and Robust Robotic Manipulation
- LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination
- Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation
- StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
- GWM-VLA: Geometry-Aware Latent World Modeling for Vision-Language-Action Learning
- Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation
- VLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic Manipulation
- OC-VLA++: Monocular Geometry-Guided Cross-View Consistency for Viewpoint-Robust Robotic Manipulation
- U-ARM : Ultra low-cost general teleoperation interface for robot manipulation
- FAST: Efficient Action Tokenization for Vision-Language-Action Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models