Can Language Model Agents be Helpful Circuit Explainers in Mechanistic Interpretability?

arXiv:2606.24026 · cs.AI · Submitted 2026-06-23 · Read on arXiv

cs.AI

Submitted: 2026-06-23

Updated: 2026-09-02

Code: https://github.com/Ziyu-Yao-NLP-Lab/LLM-Circuit-Explainer

Terminology

Sources

Related papers