DAEP: Difficulty-Aware Evidence Planning for Medical Video Corpus Temporal Answer Grounding
Tianjian He, Yujie Liu, Zhiping Huang, Changbo Xu
cs.CV, cs.CL
Submitted: 2026-08-11
Updated: 2026-08-12
Comments: 12 pages, 2 figures, 5 tables, accepted by NLPCC 2026 Shared Task Track 3
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Understanding Complexity in VideoQA via Visual Program Generation
- Overview of the NLPCC 2026 Shared Task 1: Difficulty-Aware Multilingual and Multimodal Medical Instructional Video Understanding Evaluation
- M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models