On the Pitfalls of Verbalized Confidence Priors for Calibrating Large Reasoning Models
cs.LG
Submitted: 2026-09-26
Updated: 2026-09-26
Code: https://github.com/ml-stat-Sustech/verbalized-confidence-training
Terminology
Sources
- Gemma 4 Technical Report
- Verbal Confidence Saturation in 3-9B Open-Weight Instruction-Tuned LLMs: A Pre-Registered Psychometric Validity Screen
- Training Verifiers to Solve Math Word Problems
- The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
- Rescaling Confidence: What Scale Design Reveals About LLM Metacognition
- How Uncertainty Estimation Scales with Sampling in Reasoning Models
- Olmo 3
- Reading Calibrated Uncertainty from Language Model Trajectories
- CALIBER: Calibrating Confidence Before and After Reasoning in Language Models
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Uncertainty Distillation: Teaching Language Models to Express Semantic Confidence
- RACER: Risk-Aware Calibrated Efficient Routing for Large Language Models
- OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems
- Model-agnostic Selective Labeling with Provable Statistical Guarantees
- Uncertainty in Language Models: Assessment through Rank-Calibration
- Verbalized Confidence Triggers Self-Verification: Emergent Behavior Without Explicit Reasoning Supervision
- Language Models (Mostly) Know What They Know
- Calibration without Ground Truth
- Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation
- Confidence Before Answering: A Paradigm Shift for Efficient LLM Uncertainty Estimation
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks