MotorMind: Scaffolding General Vision Language Models for Zero-Shot Robot Manipulation
cs.RO
Submitted: 2026-09-29
Updated: 2026-09-29
Project page: https://motor-mind.github.io
Terminology
Sources
- SAM 3: Segment Anything with Concepts
- VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation
- Show-Harness: Just a VLM Agent Can Play Robots
- ETA: A New Agentic Paradigm for Embodied Tasks
- RHO: Your Coding Agent is Secretly a Roboticist
- MolmoAct2: Action Reasoning Models for Real-world Deployment
- CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation
- Octo: An Open-Source Generalist Robot Policy
- Transferring the Intelligence of VLMs to Robotic Control
- VIA: Visual Interface Agent for Robot Control
- Guava: Distilling Frontier VLMs into a Compact Agent through a Robotic Manipulation Harness
- ASPIRE: Agentic /Skills Discovery for Robotics
- Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
- Cosmos 3: Omnimodal World Models for Physical AI
- Learning Affordances at Inference-Time for Vision-Language-Action Models
- HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents
- Hy-Embodied-VLM-1.0: Efficient Physical-World Agents
- Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents
- LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving