Characterizing Text Branch Sensitivity in Medical Vision-Language Segmentation via Evidence Decoupling
cs.CV, cs.AI
Submitted: 2026-09-02
Updated: 2026-09-02
Comments: 16 pages, 3 figures
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- TransUNet: Transformers Make Strong Encoders for Medical Image Segmentation
- Rethinking Atrous Convolution for Semantic Image Segmentation
- Skin Lesion Analysis Toward Melanoma Detection 2018: A Challenge Hosted by the International Skin Imaging Collaboration (ISIC)
- Uncertainty-aware Evidential Fusion-based Learning for Semi-supervised Medical Image Segmentation
- Deep evidential fusion with uncertainty quantification and contextual discounting for multimodal medical image segmentation
- UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities
- Region-Based Evidential Deep Learning to Quantify Uncertainty and Improve Robustness of Brain Tumor Segmentation
- Language-guided Medical Image Segmentation with Target-informed Multi-level Contrastive Alignments
- MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning
- Two Effects, One Trigger: On the Modality Gap, Object Bias, and Information Imbalance in Contrastive Vision-Language Models
- Progressive Uncertainty-Guided Evidential U-KAN for Trustworthy Medical Image Segmentation
- Explaining and Mitigating the Modality Gap in Contrastive Multimodal Learning
- BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models