Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents
cs.AI, cs.CL
Submitted: 2026-08-24
Updated: 2026-08-27
Code: https://github.com/lukahhcm/spare
Terminology
Sources
- On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
- MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization
- An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models
- BLINK: Multimodal Large Language Models Can See but Not Perceive
- Beyond Seeing: Evaluating Multimodal LLMs on Tool-Enabled Image Perception, Transformation, and Reasoning
- Explain Before You Answer: A Survey on Compositional Visual Reasoning
- TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models
- Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning
- A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges
- m&m's: A Benchmark to Evaluate Tool-Use for multi-step multi-modal Tasks
- Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers
- TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
- GTA: A Benchmark for General Tool Agents
- Don't Miss the Forest for the Trees: Attentional Vision Calibration for Large Vision Language Models
- V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs
- V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
- VisionZip: Longer is Better but Not Necessary in Vision Language Models
- Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
- Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
- Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection