Audit Me If You Can: Query-Efficient Active Fairness Auditing of Black-Box LLMs
cs.LG, cs.CL, cs.CY
Submitted: 2026-01-06
Updated: 2026-08-31
Terminology
Sources
- Limitations of Pinned AUC for Measuring Unintended Bias
- Active Fourier Auditor for Estimating Distributional Properties of ML Models
- Cooper: A Library for Constrained Optimization in Deep Learning
- Black-Box Audits for Group Distribution Shifts
- Holistic Evaluation of Language Models
- LoRA: Low-Rank Adaptation of Large Language Models
- Red Teaming Language Models with Language Models
- A Brief Tutorial on Sample Size Calculations for Fairness Audits
- Outsider Oversight: Designing a Third Party Audit Ecosystem for AI Governance
- Statistical Hypothesis Testing for Auditing Robustness in Language Models
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks