Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility
cs.LG, cs.AI
Submitted: 2026-08-04
Updated: 2026-08-31
Code: https://github.com/bespokelabsai/curator
Project page: https://mohsenhariri.github.io/scorio/ttshttps://huggingface.co/datasets/harimo/scorio
Terminology
Sources
- Phi-4-reasoning Technical Report
- Phi-4 Technical Report
- OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique
- OpenCodeReasoning: Advancing Data Distillation for Competitive Coding
- Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs
- NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model
- We need to talk about random seeds
- Towards Reproducible LLM Evaluation: Quantifying Uncertainty in LLM Benchmark Scores
- Evaluating Large Language Models Trained on Code
- Universal Self-Consistency for Large Language Model Generation
- Faster Minimum Bayes Risk Decoding with Confidence-based Pruning
- Training Verifiers to Solve Math Word Problems
- Process Reinforcement through Implicit Rewards
- Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs
- OpenThoughts: Data Recipes for Reasoning Models
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Truncation Sampling as Language Model Desmoothing
- Is Best-of-N the Best of Them? Coverage, Scaling, and Optimality in Inference-Time Alignment
- Hyperparameter-Free Approach for Faster Minimum Bayes Risk Decoding
- LLM-as-a-Verifier: A General-Purpose Verification Framework
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks