Self-Correction Can Amplify Hallucinations: Fact-Level Repair with Graph-Based Evidence Routing in Multimodal Generation
cs.AI, cs.LG
Submitted: 2026-05-29
Updated: 2026-08-30
Code: https://github.com/kzhao5/tiger
Terminology
Sources
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- Evaluating Hallucination in Large Vision-Language Models based on Context-Aware Object Similarities
- Emerging Properties in Unified Multimodal Pretraining
- Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training
- Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding
- Hallucination of Multimodal Large Language Models: A Survey
- Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
- Microsoft COCO Captions: Data Collection and Evaluation Server
- What Makes a Scene ? Scene Graph-based Evaluation and Feedback for Controllable Generation
- Chameleon: Mixed-Modal Early-Fusion Foundation Models
- Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs
- AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation
- VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
- VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
- Qwen2.5-Omni Technical Report
- Mario: Multimodal Graph Reasoning with Large Language Models
- Self-Correcting Decoding with Generative Feedback for Mitigating Hallucinations in Large Vision-Language Models
- EventHallusion: Diagnosing Event Hallucinations in Video LLMs
- Cross-Modal Consistency in Multimodal Large Language Models
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection