Balancing Privacy, Utility, and Safety in LLM Alignment through Preference Optimization
cs.CR, cs.LG
Submitted: 2026-08-31
Updated: 2026-08-31
Terminology
Sources
- Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback
- Exposing Privacy Gaps: Membership Inference Attack on Preference Data for LLM Alignment
- Measuring memorization in RLHF for code completion
- Privately Aligning Language Models with Reinforcement Learning
- Privacy-Preserving Instructions for Aligning Large Language Models
- FedRLHF: A Convergence-Guaranteed Federated Framework for Privacy-Preserving and Personalized RLHF
- Towards User-level Private Reinforcement Learning with Human Feedback
- Differentially Private Preference Data Synthesis for Large Language Model Alignment
- Extracting Training Data from Large Language Models
- Quantifying Memorization Across Neural Language Models
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs