Hiding in Plain Sight: A Diffusion-based Mitigation of Geolocation Privacy Leakage in Vision-Language Models
cs.CV, cs.LG
Submitted: 2026-09-18
Updated: 2026-10-07
Comments: NDSS 2027
Code: https://github.com/pyproj4/p
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- The Revolution of Multimodal Large Language Models: A Survey
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- OpenAI o1 System Card
- Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement
- DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models
- Visual Agentic Reinforcement Fine-Tuning
- Evaluation of Geolocation Capabilities of Multimodal Large Language Models and Analysis of Associated Privacy Risks
- Doxing via the Lens: Revealing Location-related Privacy Leakage on Multi-modal Large Reasoning Models
- Image-Based Geolocation Using Large Vision-Language Models
- Jailbreak Attacks and Defenses Against Large Language Models: A Survey
- Beyond Pixels: Semantic-aware Typographic Attack for Geo-Privacy Protection
- GeoShield: Safeguarding Geolocation Privacy from Vision-Language Models via Adversarial Perturbations
- From System 1 to System 2: A Survey of Reasoning Large Language Models
- Kimi k1.5: Scaling Reinforcement Learning with LLMs
- Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
- Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
- GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models
- Evaluating Precise Geolocation Inference Capabilities of Vision Language Models
- Disrupting Hierarchical Reasoning: Adversarial Protection for Geographic Privacy in Multimodal Reasoning Models
- Explaining and Harnessing Adversarial Examples
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models