Prior Directions: Separating Geometric Identification from Behavioral Efficacy in Visual Revision
cs.CV
Submitted: 2026-07-29
Updated: 2026-09-26
Code: https://github.com/phare111/prior-directions
Terminology
Sources
- Qwen3-VL Technical Report
- Mitigating Hallucinations in Large Vision-Language Models via Causal Route Gating
- How Do Vision-Language Models Process Conflicting Information Across Modalities?
- When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs
- ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use
- When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models
- Steering Vision-Language Models with Joint Sparse Autoencoders
- Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models
- Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
- Nullu: Mitigating Object Hallucinations in Large Vision-Language Models via HalluSpace Projection
- Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
- MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe
- MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models