Bridging the Gap in Ophthalmic AI: MM-Retinal-Reason Dataset and OphthaReason Model toward Dynamic Multimodal Reasoning
cs.AI
Submitted: 2025-08-22
Updated: 2026-09-16
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- MEDEC: A Benchmark for Medical Error Detection and Correction in Clinical Notes
- GPT-4 Technical Report
- Qwen2.5-VL Technical Report
- HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs
- HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
- Reasoning with Exploration: An Entropy Perspective
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- QoQ-Med: Building Multimodal Clinical Foundation Models with Domain-Aware GRPO Training
- OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
- ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step Verification
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
- OpenAI o1 System Card
- Reason Like a Radiologist: Chain-of-Thought and Reinforcement Learning for Verifiable Report Generation
- Language Models (Mostly) Know What They Know
- Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models
- LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
- EyecareGPT: Boosting Comprehensive Ophthalmology Understanding with Tailored Dataset, Benchmark and Model
- HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation
- DAB-DETR: Dynamic Anchor Boxes are Better Queries for DETR
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection