Fine-Grained Multi Image Object Hallucination Benchmark
cs.CV, cs.AI, cs.LG
Submitted: 2026-08-31
Updated: 2026-08-31
Terminology
Sources
- Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs
- Qwen2.5-VL Technical Report
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- Plausible May Not Be Faithful: Probing Object Hallucination in Vision-Language Pre-training
- Evaluating Hallucination in Large Vision-Language Models based on Context-Aware Object Similarities
- MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
- MANTIS: Interleaved Multi-Image Instruction Tuning
- Building and better understanding vision-language models: insights and future directions
- SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension
- LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
- Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
- Evaluating Object Hallucination in Large Vision-Language Models
- Beyond the Visible: Benchmarking Occlusion Perception in Multimodal Large Language Models
- Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models
- Ovis2.5 Technical Report
- MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
- RePOPE: Impact of Annotation Errors on the POPE Benchmark
- LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models
- Object Hallucination in Image Captioning
- Mitigating Object Hallucination in MLLMs via Data-augmented Phrase-level Alignment
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models