Fisheye-VLA: Decoupling Coverage and Acuity for Manipulation with a Single Fisheye Camera
cs.RO
Submitted: 2026-09-22
Updated: 2026-09-22
Terminology
Sources
- Look Closer: Bridging Egocentric and Third-Person Views with Transformers for Robotic Manipulation
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- Eye, Robot: Learning to Look to Act with a BC-RL Perception-Action Loop
- Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers
- WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation
- EgoMimic: Scaling Imitation Learning via Egocentric Video
- OpenVLA: An Open-Source Vision-Language-Action Model
- Learning Visuotactile Skills with Two Multifingered Hands
- Gaze-based dual resolution deep imitation learning for high-precision dexterous robot manipulation
- Active Vision Might Be All You Need: Exploring Active Vision in Bimanual Robotic Manipulation
- BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model
- OmniDP: Beyond-FOV Large-Workspace Humanoid Manipulation with Omnidirectional 3D Perception
- Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action
- Imagination at Inference: Synthesizing In-Hand Views for Robust Visuomotor Policy Inference
- ROI-Driven Foveated Attention for Unified Egocentric Representations in Vision-Language-Action Systems
- Rethinking Camera Choice: An Empirical Study on Fisheye Camera Properties in Robotic Manipulation
- VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training
- Fisheye3R: Adapting Unified 3D Feed-Forward Foundation Models to Fisheye Lenses
- Cameras as Relative Positional Encoding
- Do You Know Where Your Camera Is? View-Invariant Policy Learning with Camera Conditioning
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving