ActiveScale: Scaling Active Perception for Robots across Model, Data, and Hardware
cs.RO, cs.LG
Submitted: 2026-09-16
Updated: 2026-09-19
Comments: active-scale.github.io
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
- SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
- ActiveMimic: Egocentric Video Pretraining with Active Perception
- EgoMI: Learning Active Vision and Whole-Body Manipulation from Egocentric Human Demonstrations
- Vision in Action: Learning Active Perception from Human Demonstrations
- Eye, Robot: Learning to Look to Act with a BC-RL Perception-Action Loop
- ActiveUMI: Robotic Manipulation with Active Perception from Robot-Free Human Demonstrations
- EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data
- Emergence of Human to Robot Transfer in Vision-Language-Action Models
- StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
- SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model
- A Pragmatic VLA Foundation Model
- DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
- GEM: Generative Supervision Helps Embodied Intelligence
- DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
- Cambrian-P: Pose-Grounded Video Understanding
- PaliGemma: A versatile 3B VLM for transfer
- FAST: Efficient Action Tokenization for Vision-Language-Action Models
- EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving