Instability Floors: Separating Bias from Noise in Fairness Audits of Clinical LLM Agents with FairMedAgent
cs.CL, cs.AI, cs.CY, cs.LG, stat.AP
Submitted: 2026-09-02
Updated: 2026-09-29
Comments: 13 pages, 1 figure, 2 tables. Code and data: https://github.com/rohithreddybc/FairMedAgent
Code: https://github.com/rohithreddybc/FairMedAgent
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- AgentFairBench: Do LLM Agents Discriminate When They Act?
- EQUITRIAGE: A Fairness Audit of Gender Bias in LLM-Based Emergency Department Triage
- CLIMB: A Benchmark of Clinical Bias in Large Language Models
- How Can We Diagnose and Treat Bias in Large Language Models for Clinical Decision-Making?
- Bias patterns in the application of LLMs for clinical decision support: A comprehensive study
- AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments
- MedAgentBench: A Realistic Virtual EHR Environment to Benchmark Medical LLM Agents
- MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks
- Counterfactual Fairness
- Fairness Testing: A Comprehensive Survey and Analysis of Trends
- Aequitas: A Bias and Fairness Audit Toolkit
- Equality of Opportunity in Supervised Learning
- Understanding and Mitigating Numerical Sources of Nondeterminism in LLM Inference
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering