D squared-VLA: Dual-Memory Dual-Frequency Vision-Language-Action Model For Long Dynamic Manipulation
cs.CV
Submitted: 2026-09-28
Updated: 2026-09-30
Terminology
Sources
- PaliGemma: A versatile 3B VLM for transfer
- Real-Time Execution of Action Chunking Flow Policies
- RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
- InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing
- RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies
- SeedPolicy: Horizon Scaling via Self-Evolving Diffusion Policy for Robot Manipulation
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
- ReMem-VLA: Empowering Vision-Language-Action Model with Memory via Dual-Level Recurrent Queries
- CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- Vision-Language Foundation Models as Effective Robot Imitators
- FAVLA: A Force-Adaptive Fast-Slow VLA model for Contact-Rich Robotic Manipulation
- RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- FAST: Efficient Action Tokenization for Vision-Language-Action Models
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- MemER: Scaling Up Memory for Robot Control via Experience Retrieval
- TempoFit: Plug-and-Play Layer-Wise Temporal KV Memory for Long-Horizon Vision-Language-Action Manipulation
- VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models