Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA
Yuanlei Zheng, Pei Fu, Hang Li, Ziyang Wang, Yuyi Zhang, Wenyu Ruan, Xiaojin Zhang, Zhongyu Wei, Zhenbo Luo, Jian Luan, Wei Chen, Xiang Bai
cs.CL
Submitted: 2026-08-20
Updated: 2026-08-21
Terminology
Sources
- Qwen2.5-VL Technical Report
- SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding
- M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding
- Deep Learning based Visually Rich Document Content Understanding: A Survey
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- ColPali: Efficient Document Retrieval with Vision Language Models
- LayoutLLM: Large Language Model Instruction Tuning for Visually Rich Document Understanding
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- GPT-4o System Card
- TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
- URaG: Unified Retrieval and Generation in Multimodal LLMs for Efficient Long Document Understanding
- Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
- MinerU: An Open-Source Solution for Precise Document Content Extraction
- VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
- C-Pack: Packed Resources For General Chinese Embeddings
- PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling
- CogDoc: Towards Unified thinking in Documents
- DocAgent: A Multi-Agent System for Automated Code Documentation Generation
- VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
- InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering