OR-Transformer: Scaling Real-Time Decision-Making to 1,000 Items
cs.LG
Submitted: 2026-09-01
Updated: 2026-09-04
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients
- gym-invmgmt: An Open Benchmarking Framework for Inventory Management Methods
- Robust Data-Collection Policy Learning for Low-Variance Online Policy Evaluation
- Fast Rates in $\alpha$-Potential Games via Regularized Mirror Descent
- Pessimism-Free Offline Learning in General-Sum Games via KL Regularization
- Strategic Bargaining in Multi-Buyer Markets: Reinforcement Learning from Verifiable Rewards for LLM Negotiations
- Instructing LLMs to Negotiate using Reinforcement Learning with Verifiable Rewards
- Deep Inventory Management
- Proximal Policy Optimization Algorithms
- Predicting Plasticity in Deep Continual Learning: A Theoretical Perspective
- An (R, S) Based Heuristic Model for the Stochastic Joint Replenishment Problem
- Beyond Linear Attention: Softmax Transformers Implement In-Context Reinforcement Learning
- Beyond Pessimism: Offline Learning in KL-regularized Games
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks