Robust Data-Collection Policy Learning for Low-Variance Online Policy Evaluation
cs.LG, stat.ML
Submitted: 2026-08-25
Updated: 2026-08-25
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification
- Fast Rates in $\alpha$-Potential Games via Regularized Mirror Descent
- Pessimism-Free Offline Learning in General-Sum Games via KL Regularization
- Strategic Bargaining in Multi-Buyer Markets: Reinforcement Learning from Verifiable Rewards for LLM Negotiations
- Instructing LLMs to Negotiate using Reinforcement Learning with Verifiable Rewards
- MathlibLemma: Folklore Lemma Generation and Benchmark for Formal Mathematics
- Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
- Predicting Plasticity in Deep Continual Learning: A Theoretical Perspective
- Policy Gradient for Robust Markov Decision Processes
- Beyond Linear Attention: Softmax Transformers Implement In-Context Reinforcement Learning
- Linear Convergence of Natural Policy Gradient Methods with Log-Linear Policies
- Beyond Pessimism: Offline Learning in KL-regularized Games
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks