Simulated Self-Assessment in Large Language Models: A Psychometric Approach to AI Self-Efficacy
cs.AI
Submitted: 2025-11-25
Updated: 2026-08-25
Code: https://github.com/official-daniel-jackson/llm-self-efficacy
Terminology
Sources
- RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models
- EffiBench-X: A Multi-Language Benchmark for Measuring Efficiency of LLM-Generated Code
- Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models
- Measuring Massive Multitask Language Understanding
- Internal Consistency and Self-Feedback in Large Language Models: A Survey
- Evaluating LLM Metrics Through Real-World Capabilities
- Training Verifiers to Solve Math Word Problems
- Have Large Language Models Developed a Personality?: Applicability of Self-Assessment Tests in Measuring Personality in LLMs
- Bias Runs Deep: Implicit Reasoning Biases in Persona-Assigned LLMs
- Pitfalls of Evaluating Language Models with Open Benchmarks
- LiveBench: A Challenging, Contamination-Limited LLM Benchmark
- Proof or Bluff? Evaluating LLMs on 2025 USA Math Olympiad
- LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts
- ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning
- RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios
- The Hallucinations Leaderboard -- An Open Effort to Measure Hallucinations in Large Language Models
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection