NeuronGuard: Robust LLM Safety Alignment via Ablation-Aware Safety Signal Redistribution
cs.CR, cs.AI, cs.IR, cs.LG
Submitted: 2026-08-25
Updated: 2026-08-25
Terminology
Sources
- Phi-4 Technical Report
- Detecting Language Model Attacks with Perplexity
- Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback
- Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
- The Llama 3 Herd of Models
- Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations
- Training Verifiers to Solve Math Word Problems
- SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
- Gemma: Open Models Based on Gemini Research and Technology
- The Blessing and Curse of Dimensionality in Safety Alignment
- SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
- Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing
- Universal and Transferable Adversarial Attacks on Aligned Language Models
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs