Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models
cs.RO, cs.AI, cs.CV
Submitted: 2026-08-05
Updated: 2026-09-17
Comments: This submission has been withdrawn by the authors due to unresolved differences among the coauthors regarding the manuscript's novelty and technical positioning, including substantial overlap with concurrent work
Code: https://github.com/box2ai-robotics/joycon-robotics
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Do As I Can, Not As I Say: Grounding Language in Robotic Affordances
- PaliGemma: A versatile 3B VLM for transfer
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- RT-1: Robotics Transformer for Real-World Control at Scale
- Inner Monologue: Embodied Reasoning through Planning with Language Models
- OpenVLA: An Open-Source Vision-Language-Action Model
- HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy
- BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation
- RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
- Octo: An Open-Source Generalist Robot Policy
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
- dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
- Genie Sim 3.0 : A High-Fidelity Comprehensive Simulation Platform for Humanoid Robot
- Robotic Control via Embodied Chain-of-Thought Reasoning
- DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving