What Can a Leaderboard Certify? Compositional Controllability for Fair Evaluation and Training of Biomedical Literature-Review Agents
cs.LG, cs.AI, cs.CL
Submitted: 2026-09-26
Updated: 2026-09-26
Code: https://github.com/shawnzhg/LitReview-SCRIBE
Terminology
Sources
- OTAP: Structure-Aware Optimal Transport for Evaluating Planning and Execution in Agent Trajectories
- Domain-Specific Language Model Pretraining for Biomedical Natural Language Processing
- ADRA-Bank: A Modular Benchmark for Academic Deep Research Agents
- KV-Skill: Forging Expertise in the Model's Native Language
- Log analysis is necessary for credible evaluation of AI agents
- Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations
- SurveyG: A Multi-Agent LLM Framework with Hierarchical Citation Graph for Automated Survey Generation
- Qwen3 Technical Report
- LLM$\times$MapReduce-V2: Entropy-Driven Convolutional Test-Time Scaling for Generating Long-Form Articles from Extremely Long Resources
- "LLM Agent Performance" Is Not a Single Evaluation Target
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks