DataShield: Uncovering Risky Fine-Tuning Data Across LLMs Through Consensus Subspace Alignment
Zefeng Wu, Weiwei Qi, Jielong Chen, Tianhang Zheng, Di Hong, Chaochao Lu, Liang He, Zhan Qin, Kui Ren
cs.CR
Submitted: 2026-07-16
Comments: 24 pages, 12 figures, 19 tables
Code: https://github.com/sahil280114/codealpaca
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Safety-Aware Fine-Tuning of Large Language Models
- Training Verifiers to Solve Math Word Problems
- Phi-4 Technical Report
- SRA: Span Representation Alignment for Large Language Model Distillation
- Constitutional AI: Harmlessness from AI Feedback
- An Information-Theoretic Perspective on LLM Tokenizers
- The Llama 3 Herd of Models
- Benign Samples Matter! Fine-tuning On Outlier Benign Samples Severely Breaks Safety
- What is in Your Safe Data? Identifying Benign Data that Breaks Safety
- Evaluating Large Language Models Trained on Code
- Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
- Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
- Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
- NonTextual Target Attack
- DualBreach: Efficient Dual-Jailbreaking via Target-Driven Initialization and Multi-Target Optimization
- Qwen2.5-Coder Technical Report
- GPT-4o System Card
- Mixtral of Experts
- SaLoRA: Safety-Alignment Preserved Low-Rank Adaptation
- Token-level Data Selection for Safe LLM Fine-tuning
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs