ActionUNet: Improving Robustness of VLA Models with Efficient Multi-scale Fine-tuning
cs.CV, cs.RO
Submitted: 2026-09-28
Updated: 2026-09-28
Code: https://github.com/Di-Zhu123/ActionUNet
Terminology
Sources
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning
- Distracted Robot: How Visual Clutter Undermine Robotic Manipulation
- Learning Native Continuation for Action Chunking Flow Policies
- PaliGemma: A versatile 3B VLM for transfer
- Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
- FAST: Efficient Action Tokenization for Vision-Language-Action Models
- CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation
- Quantization-Free Autoregressive Action Transformer
- The Compression Gap: Why Discrete Tokenization Limits Vision-Language-Action Model Scaling
- HiFlow: Tokenization-Free Scale-Wise Autoregressive Policy Learning via Flow Matching
- HiPolicy: Hierarchical Multi-Frequency Action Chunking for Policy Learning
- Dense Policy: Bidirectional Autoregressive Learning of Actions
- Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation
- Mimic Intent, Not Just Trajectories
- RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
- LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
- WorldVLA: Towards Autoregressive Action World Model
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models