TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
cs.CV, cs.RO
Submitted: 2026-07-29
Updated: 2026-09-27
Code: https://github.com/H-EmbodVis/TurboVLAhttps:
Project page: https://h-embodvis.github.io/TurboVLA
Terminology
Sources
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- SeedPolicy: Horizon Scaling via Self-Evolving Diffusion Policy for Robot Manipulation
- The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning
- CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- FASTER: Rethinking Real-Time Flow VLAs
- Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- DINOv3
- StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models