Mask2Shield: Strengthening LLM Safety against Neuron-Pruning Attacks
Ying JinCheng, Minghui Xu, Yinhao Xiao, Xiuzhen Cheng, Wencheng Yang
cs.CR
Submitted: 2026-07-25
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- NeuroStrike: Neuron-Level Attacks on Aligned LLMs
- SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
- Constitutional AI: Harmlessness from AI Feedback
- Universal and Transferable Adversarial Attacks on Aligned Language Models
- Jailbreaking Black Box Large Language Models in Twenty Queries
- NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
- NeuRel-Attack: Neuron Relearning for Safety Disalignment in Large Language Models
- Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining
- Refusal in Language Models Is Mediated by a Single Direction
- Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction
- The Llama 3 Herd of Models
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Gemma: Open Models Based on Gemini Research and Technology
- Phi-4 Technical Report
- Training Verifiers to Solve Math Word Problems
- HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
- Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs