Watch, Recall, Act: Always-On Robots in Concurrent Embodied Streams
cs.RO
Submitted: 2026-09-23
Updated: 2026-09-23
Terminology
Sources
- ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Language Models
- OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
- RIVER: A Real-Time Interaction Benchmark for Video LLMs
- Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding
- ReMem-VLA: Empowering Vision-Language-Action Model with Memory via Dual-Level Recurrent Queries
- SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models
- Habilis-$\beta$: A Fast-Motion and Long-Lasting On-Device Vision-Language-Action Model
- VITA-E: Natural Embodied Interaction with Concurrent Seeing, Hearing, Speaking, and Acting
- RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics
- Enter the Mind Palace: Reasoning and Planning for Long-term Active Embodied Question Answering
- Chameleon: Control-Indexed Prospective Memory for Visuomotor Manipulation
- Imagine, Verify, Execute: Memory-guided Agentic Exploration with Vision-Language Models
- Reflective Planning: Vision-Language Models for Multi-Stage Long-Horizon Robotic Manipulation
- VideoLLM-online: Online Video Large Language Model for Streaming Video
- StreamingVLM: Real-Time Understanding for Infinite Video Streams
- MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
- Streaming Video Instruction Tuning
- StreamVLA: Breaking the Reason-Act Cycle via Completion-State Gating
- OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
- Real-Time Execution of Action Chunking Flow Policies
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving