Towards Mitigating Excessive Forgetting in LLM Unlearning via Entanglement-Guidance with Proxy Constraint
cs.LG, cs.AI
Submitted: 2025-08-28
Updated: 2026-09-22
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Textbooks Are All You Need II: phi-1.5 technical report
- Jailbreaking ChatGPT via Prompt Engineering: An Empirical Study
- An Adversarial Perspective on Machine Unlearning for AI Safety
- TOFU: A Task of Fictitious Unlearning for LLMs
- Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks
- Machine Unlearning Fails to Remove Data Poisoning Attacks
- Detecting Pretraining Data from Large Language Models
- MUSE: Machine Unlearning Six-Way Evaluation for Language Models
- Improved Localized Machine Unlearning Through the Lens of Memorization
- Llama 2: Open Foundation and Fine-Tuned Chat Models
- Dual-View Inference Attack: Machine Unlearning Amplifies Privacy Exposure
- Exploring Criteria of Loss Reweighting to Enhance LLM Unlearning
- Machine Unlearning of Pre-trained Large Language Models
- GPT-4 Technical Report
- Toward Mass-Production of Transition Metal Dichalcogenide Solar Cells: Scalable Growth of Photovoltaic-Grade Multilayer WSe2 by Tungsten Selenization
- Qwen Technical Report
- Unified Gradient-Based Machine Unlearning with Remain Geometry Enhancement
- Knowledge Unlearning for Mitigating Privacy Risks in Language Models
- SOUL: Unlocking the Power of Second-Order Optimization for LLM Unlearning
- Copyright Violations and Large Language Models
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks