Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning
cs.CV, cs.AI
Submitted: 2026-06-30
Updated: 2026-09-24
Terminology
Sources
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering
- RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs
- HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
- Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models
- QoQ-Med: Building Multimodal Clinical Foundation Models with Domain-Aware GRPO Training
- FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning
- ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step Verification
- LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day
- MedThink: Explaining Medical Visual Question Answering via Multimodal Decision-Making Rationale
- Reasoning Models Hallucinate More: Factuality-Aware Reinforcement Learning for Large Reasoning Models
- SLAKE: A Semantically-Labeled Knowledge-Enhanced Dataset for Medical Visual Question Answering
- PeFoMed: Parameter Efficient Fine-tuning of Multimodal Large Language Models for Medical Imaging
- Visual Instruction Tuning
- PathVQA: 30000+ Questions for Medical Visual Question Answering
- GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
- LoRA: Low-Rank Adaptation of Large Language Models
- Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation
- MedVLThinker: Simple Baselines for Multimodal Medical Reasoning
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models