AWM: Answerable Working Memory for Long-Document VQA Agents
cs.CL
Submitted: 2026-08-26
Updated: 2026-08-26
Comments: EMNLP 2026 Findings. 16 pages, 4 figures, 9 tables
Code: https://github.com/DongzhuoranZhou/AWM
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding
- M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding
- Patchscopes: A Unifying Framework for Inspecting Hidden Representations of Language Models
- MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning
- Auditing Data Membership in Reinforcement Learning With Verifiable Rewards
- VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
- Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs
- EDGE: Experience-Distillation for Guided Exploration in Agentic Reinforcement Learning
- MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning
- Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA
- Evaluating Knowledge Graph Based Retrieval Augmented Generation Methods under Knowledge Incompleteness
- GR-Agent: Adaptive Graph Reasoning Agent under Incomplete Knowledge
- Look Inward to Explore Outward: Learning Temperature Policy from LLM Internal States via Hierarchical RL
- Conformalized Large Language Models under Configuration Shift
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering