EDCT-Bench: Uncovering Faithfulness Gaps in VLMs via Explanation-Driven Counterfactual Testing
cs.CV, cs.AI
Submitted: 2026-09-16
Updated: 2026-09-16
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- A Survey on LLM-as-a-Judge
- LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods
- Counterfactual Evaluation for Blind Attack Detection in LLM-based Evaluation Systems
- Faithfulness vs. Plausibility: On the (Un)Reliability of Explanations from Large Language Models
- Pixtral 12B
- Distilling Counterfactual Reasoning from Language to Vision: Causal Graph Guided Post-Training for Video Understanding
- SAM 2: Segment Anything in Images and Videos
- Gemma 3 Technical Report
- Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking
- OmniGen2: Towards Instruction-Aligned Multimodal Generation
- Qwen3 Technical Report
- CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples
- CF-VLM:CounterFactual Vision-Language Fine-tuning
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models