FiberTune: Preserving Action-Fiber Visual Residuals in Vision-Language-Action Fine-Tuning
cs.CV, cs.AI, cs.LG, cs.RO
Submitted: 2026-06-07
Updated: 2026-09-13
Comments: Accepted at CoRL 2026. Project page: https://fibertune.github.io/ . Code: https://github.com/fibertune/FiberTune
Code: https://github.com/fibertune/FiberTune
Project page: https://fibertune.github.io
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Do As I Can, Not As I Say: Grounding Language in Robotic Affordances
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
- CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization
- MAPS: Preserving Vision-Language Representations via Module-Wise Proximity Scheduling for Better Vision-Language-Action Generalization
- ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy
- CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning
- Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation
- FAST: Efficient Action Tokenization for Vision-Language-Action Models
- Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
- Contrastive Representation Regularization for Vision-Language-Action Models
- Rethinking Latent Redundancy in Behavior Cloning: An Information Bottleneck Approach for Robot Manipulation
- LangForce: Bayesian Decomposition of Vision Language Action Models via Latent Action Queries
- LeRobot: An Open-Source Library for End-to-End Robot Learning
- RLinf: Flexible and Efficient Large-scale Reinforcement Learning via Macro-to-Micro Flow Transformation
- RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models