Privacy Without Regret: Differentially Private Inference-Time Alignment
cs.LG
Submitted: 2026-08-26
Updated: 2026-08-26
Code: https://github.com/tatsu-lab/alpaca_eval
Terminology
Sources
- Training Verifiers to Solve Math Word Problems
- Measuring Massive Multitask Language Understanding
- Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models
- WebGPT: Browser-assisted question-answering with human feedback
- Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
- Differentially Private Fine-tuning of Language Models
- On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference
- KL-regularization Itself is Differentially Private in Bandits and RLHF
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks