When Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Indexing for Knowledge-Faithful Generative Perception
cs.MM, cs.AI, cs.CV, cs.GR
Submitted: 2026-08-21
Updated: 2026-08-31
Comments: 20 pages, 7 figures, and 20 tables
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs
- TRACER: Token ReAssignment for Concept ERasure in Generative Recommendation
- Evolve as a Team: Collaborative Self-Evolution for LLM-based Multi-Agent Systems
- Toward Cognitive Supersensing in Multimodal Large Language Model
- ConMem: Contribution-Aware Memory for Long-Horizon Manufacturing Inspection Logs
- Dual-Pathway Circuits of Object Hallucination in Vision-Language Models
- PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation
- Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents
- Decoding Children's Gait Behavior
- SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features
- CoRe3D: Collaborative Reasoning as a Foundation for 3D Intelligence
- ELSA3D: Elastic Semantic Anchoring for Unified 3D Understanding and Generation
- HMPE:HeatMap Embedding for Efficient Transformer-Based Small Object Detection
- TriAlignGR: Triangular Multitask Alignment with Multimodal Deep Interest Mining for Generative Recommendation
- DeepInterestGR: Mining Deep Multi-Interest Using Multi-Modal LLMs for Generative Recommendation
- MemMark: State-Evolution Attribution Watermarking for Agent Long-Term Memory Systems
Related papers
- ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
- Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
- Mitigating GenAI-powered Evidence Pollution for Out-of-Context Multimodal Misinformation Detection
- A Rate-Distortion-Classification Approach for Lossy Image Compression