Visual Branch is What You Need for CLIP-based Class-Incremental Learning
cs.CV, cs.LG
Submitted: 2026-09-29
Updated: 2026-09-30
Terminology
Sources
- Efficient Lifelong Learning with A-GEM
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- What do Vision Transformers Learn? A Visual Exploration
- Distilling the Knowledge in a Neural Network
- Addressing Imbalanced Domain-Incremental Learning through Dual-Balance Collaborative Experts
- Class Incremental Learning with Pre-trained Vision-Language Models
- Continual Learning on CLIP via Incremental Prompt Tuning with Intrinsic Textual Anchors
- Fine-Grained Visual Classification of Aircraft
- DINOv2: Learning Robust Visual Features without Supervision
- UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild
- C3Box: A CLIP-based Class-Incremental Learning Toolbox
- SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning
- Lifelong Learning with Dynamically Expandable Networks
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models