Beyond Average Safety: Chance-Constrained LLM Fine-tuning
cs.LG, cs.AI
Submitted: 2026-09-24
Updated: 2026-09-24
Terminology
Sources
- Training Verifiers to Solve Math Word Problems
- Safe RLHF: Safe Reinforcement Learning from Human Feedback
- Covert Malicious Finetuning: Challenges in Safeguarding LLM Adaptation
- Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation
- LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B
- SaLoRA: Safety-Alignment Preserved Low-Rank Adaptation
- Antibody: Strengthening Defense Against Harmful Fine-Tuning for Large Language Models via Attenuating Harmful Gradient Influence
- Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!
- Reward Constrained Policy Optimization
- Projection-Based Constrained Policy Optimization
- Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models
- Gradient Surgery for Safe LLM Fine-Tuning
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks