Devil in the Lens: Analyzing and Defending Physical Prompt Injection Against Vision-Language Models on Wearable Devices
Yaxin Li, Hao Wang, Yanda Shao, Shuhao Zhang, Yan Long
cs.CR
Submitted: 2026-07-11
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Physical Prompt Injection Attacks on Large Vision-Language Models
- Automatic and Universal Prompt Injection Attacks against Large Language Models
- Vision-LLMs Can Fool Themselves with Self-Generated Typographic Attacks
- Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors
- Model-agnostic Adversarial Attack and Defense for Vision-Language-Action Models
- Abusing Images and Sounds for Indirect Instruction Injection in Multi-Modal LLMs
- AI-based Wearable Vision Assistance System for the Visually Impaired: Integrating Real-Time Object Recognition and Contextual Understanding Using Large Vision-Language Models
- CHAI: Command Hijacking against embodied AI
- Exploring Typographic Visual Prompts Injection Threats in Cross-Modality Generation Models
- Words or Vision: Do Vision-Language Models Have Blind Faith in Text?
- Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs