Med-RADIO: Reducing All Medical Domains Into One via Multi-Teacher Distillation
cs.CV
Submitted: 2026-09-29
Updated: 2026-09-29
Code: https://github.com/CAIR-HKISI/Med-RADIO
Terminology
Sources
- SAM 3: Segment Anything with Concepts
- Curia: A Multi-Modal Foundation Model for Radiology
- MRI-CORE: A Foundation Model for Magnetic Resonance Imaging
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- Generalist Foundation Models from a Multimodal Dataset for 3D Computed Tomography
- Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding
- UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities
- Ensemble learning of pathology foundation models for precision oncology
- DINOv2: Learning Robust Visual Features without Supervision
- Vision Foundation Models for Computed Tomography
- Efficient Knowledge Distillation of SAM for Medical Image Segmentation
- VisionFM: a Multi-Modal Multi-Task Vision Foundation Model for Generalist Ophthalmic Artificial Intelligence
- Foundation Models in Medical Image Analysis: A Systematic Review and Meta-Analysis
- C-RADIOv4 (Tech Report)
- SAM 2: Segment Anything in Images and Videos
- From Task-Specific Models to Unified Systems: A Review of Model Merging Approaches
- EyeFound: A Multimodal Generalist Foundation Model for Ophthalmic Imaging
- EyeCLIP: A visual-language foundation model for multi-modal ophthalmic image analysis
- DINOv3
- Unifying Biomedical Vision-Language Expertise: Towards a Generalist Foundation Model via Multi-CLIP Knowledge Distillation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models