QC-Stark: A Multi-Task Benchmark Revealing Capability Dissociations in LLMs Evaluated on Quantum Computing Tasks
quant-ph, cs.AI, cs.LG
Submitted: 2026-09-28
Updated: 2026-09-28
Terminology
Sources
- Qiskit QuantumKatas: Adapting Microsoft's Quantum Computing exercises for LLM evaluation
- Quantum-Audit: Evaluating the Reasoning Limits of LLMs on Quantum Computing
- QCircuitBench: A Large-Scale Dataset for Benchmarking Quantum Algorithm Design
- SciCode: A Research Coding Benchmark Curated by Scientists
- CMT-Benchmark: A Benchmark for Condensed Matter Theory Built by Expert Researchers
- Holistic Evaluation of Language Models
- Qiskit HumanEval: An Evaluation Benchmark For Quantum Code Generative Models
- Are Emergent Abilities of Large Language Models a Mirage?
- Tulu 3: Pushing Frontiers in Open Language Model Post-Training
Related papers
- Reconquering Bell sampling on qudits: stabilizer learning and testing, quantum pseudorandomness bounds, and more
- Encrypted clones can leak: Classification of informative subsets in Quantum Encrypted Cloning
- Polynomial-time classical and quantum simulation of quantum impurity models
- Theory of quantum-enhanced interferometry with general Markovian light sources
- A convergent hierarchy of spectral gap certificates for qubit Hamiltonians
- Universal Bound and Phase Transition in Many-Body Fermionic Non-Gaussianity