KerColle: Unlocking Fine-Grained GPU Concurrency in Vision-Language-Action Models
cs.AR, cs.RO
Submitted: 2026-09-16
Updated: 2026-09-16
Terminology
Sources
- Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- PaliGemma: A versatile 3B VLM for transfer
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- Real-Time Execution of Action Chunking Flow Policies
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- RT-1: Robotics Transformer for Real-World Control at Scale
- GR-3 Technical Report
- Fast-in-Slow: A Dual-System Foundation Model Unifying Fast Manipulation within Slow Reasoning
- Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
- cuDNN: Efficient Primitives for Deep Learning
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models
- Kitsune: Enabling Dataflow Execution on GPUs
- GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data
- Characterizing Concurrency Mechanisms for NVIDIA GPUs under Deep Learning Workloads
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- How Fast Can I Run My VLA? Demystifying VLA Inference Performance with VLA-Perf
- AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models
- Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models
- DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset
- OpenVLA: An Open-Source Vision-Language-Action Model
Related papers
- WitCert: Sound Runtime Risk Observability and Gating for KV-Cache Quantization
- Golden Ruler: A Numeric Format Catalog with Bit-Exact Conformance Vectors for FP8, BF16, MXFP4, and Microscaling Formats
- PoisonCap: Efficient Hierarchical Temporal Safety for CHERI
- Provisioning to Runtime Optimization of a 100 MW-Scale AI Cluster
- Bit-Accurate Modeling of GPU Matrix Multiply-Accumulate Units: Demystifying Numerical Discrepancy and Accuracy
- Optimizing Polynomial Multiplication and Fixed-Weight Sampling for HQC on ARM Cortex-M4