Gradient-Stable Attention Heads Signal LLM Correctness
cs.LG
Submitted: 2026-02-14
Updated: 2026-09-17
Journal ref: EMNLP 2026, Findings track
Code: https://github.com/StanfordMIMI/HeadEntropy
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Overconfidence is Key: Verbalized Uncertainty Evaluation in Large Language and Vision-Language Models
- A Gentle Introduction to Conformal Prediction and Distribution-Free Uncertainty Quantification
- TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension
- Language Models (Mostly) Know What They Know
- Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation
- Suitability Filter: A Statistical Framework for Classifier Evaluation in Real-World Deployment Settings
- Calibrating Language Models with Adaptive Temperature Scaling
- Large Language Models Encode Clinical Knowledge
- Advancing Multimodal Medical Capabilities of Gemini
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks