SegBanana: Steering Unified Multimodal Models into Medical Segmenters
cs.CV
Submitted: 2026-09-28
Updated: 2026-09-28
Terminology
Sources
- The RSNA-ASNR-MICCAI BraTS 2021 Benchmark on Brain Tumor Segmentation and Radiogenomic Classification
- Skin Lesion Analysis Toward Melanoma Detection 2018: A Challenge Hosted by the International Skin Imaging Collaboration (ISIC)
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- Emerging Properties in Unified Multimodal Pretraining
- Image Generators are Generalist Vision Learners
- Vision as Unified Multimodal Generation
- GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
- IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation
- PixelArena: A benchmark for Pixel-Precision Visual Intelligence
- UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
- MedSAM3: Delving into Segment Anything with Medical Concepts
- MedSAM-Agent: Empowering Interactive Medical Image Segmentation with Multi-turn Agentic Reinforcement Learning
- Matcher: Segment Anything with One Shot Using All-Purpose Feature Matching
- Zero-shot capability of SAM-family models for bone segmentation in CT scans
- Preference Adaptive and Sequential Text-to-Image Generation
- A Survey on Domain Generalization for Medical Image Analysis
- Agentic Retoucher for Text-To-Image Generation
- DINOv3
- Chameleon: Mixed-Modal Early-Fusion Foundation Models
- ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models