Vis-Poison: Poisoning Visual Knowledge in Multimodal Retrieval-Augmented Generation
cs.CV, cs.AI
Submitted: 2026-08-21
Updated: 2026-08-28
Comments: Findings of EMNLP, 2026
Code: https://github.com/SWUFE-DB-Group/Vis-Poison
Project page: https://openai.github.io/openai-guardrails-python/ref/checks/jailbreak
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- SegSub: Evaluating Robustness to Knowledge Conflicts and Hallucinations in Vision-Language Models
- Hidden in the Metadata: Stealth Poisoning Attacks on Multimodal Retrieval-Augmented Generation
- Qwen3-VL Technical Report
- MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Poisoning Attacks
- Beyond Text: Optimizing RAG with Multimodal Inputs for Industrial Applications
- CPA-RAG:Covert Poisoning Attacks on Retrieval-Augmented Generation in Large Language Models
- Adversarial attacks against Modern Vision-Language Models
- Spa-VLM: Stealthy Poisoning Attacks on RAG-based VLM
- AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models