Decision-Level Hijacking: Injecting Cognitive Bias into Large Language Models via Bit-Flip Attacks
Yu Yan, Jiahao Chen, Siqi Lu, Yongjuan Wang, Ziming Zhao, Zhaoxuan Li, Tianyu Du, Qingjun Yuan, Shouling Ji
cs.CR, cs.LG
Submitted: 2026-07-28
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Customization under Fire: Plugin Poisoning in Text-to-Image Ecosystem
- LoRAShield: Data-Free Editing Alignment for Secure Personalized LoRA Sharing
- Rethinking the Vulnerabilities of Face Recognition Systems:From a Practical Perspective
- GenBFA: An Evolutionary Optimization Approach to Bit-Flip Attacks on LLMs
- SnapGuard: Lightweight Prompt Injection Detection for Screenshot-Based Web Agents
- BadNets: Identifying Vulnerabilities in the Machine Learning Model Supply Chain
- SBFA: Single Sneaky Bit Flip Attack to Break Large Language Models
- TFL: Targeted Bit-Flip Attack on Large Language Model
- Unveiling Large Language Model Supply Chain: Structure, Domain, and Vulnerabilities
- Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training
- BadEdit: Backdooring large language models by model editing
- WaNet -- Imperceptible Warping-based Backdoor Attack
- Dullahan: Stealthy Backdoor Attack against Without-Label-Sharing Split Learning
- BadGPT: Exploring Security Vulnerabilities of ChatGPT via Backdoor Attacks to InstructGPT
- Targeted Bit-Flip Attacks on LLM-Based Agents
- AEIOU: A Unified Defense Framework against NSFW Prompts in Text-to-Image Models
- BitHydra: Towards Bit-flip Inference Cost Attack against Large Language Models
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs