SAM Meets VLM: Parameter-Decoupled Full-Parameter Training for Unified Medical Reasoning and Segmentation
cs.CV
Submitted: 2026-09-29
Updated: 2026-09-29
Terminology
Sources
- Qwen2.5-VL Technical Report
- CheXpert Plus: Augmenting a Large Chest X-ray Dataset with Text Radiology Reports, Patient Demographics and Additional Image Formats
- ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models
- HuatuoGPT-II, One-stage Training for Medical Adaption of LLMs
- HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs
- HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
- FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning
- Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models
- Towards a Multimodal Large Language Model with Pixel-Level Insight for Biomedicine
- DenseNet: Implementing Efficient ConvNet Descriptor Pyramids
- ChatDoctor: A Medical Chat Model Fine-Tuned on a Large Language Model Meta-AI (LLaMA) Using Medical Domain Knowledge
- PMC-CLIP: Contrastive Language-Image Pre-training using Biomedical Documents
- Improved Baselines with Visual Instruction Tuning
- SAM 2: Segment Anything in Images and Videos
- A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge
- MedGemma Technical Report
- MedGround-R1: Advancing Medical Image Grounding via Spatial-Semantic Rewarded Group Relative Policy Optimization
- Citrus: Leveraging Expert Cognitive Pathways in a Medical Language Model for Advanced Medical Decision Support
- Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning
- MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models