Circuit Condensation: Post-Training that Concentrates a Behavior's Causal Circuit
cs.LG
Submitted: 2026-08-27
Updated: 2026-08-27
Comments: 27 pages, 5 figures
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Certified Circuits: Stability Guarantees for Mechanistic Circuits
- Language Model Circuits Are Sparse in the Neuron Basis
- Quantifying LLM Attention-Head Stability: Implications for Circuit Universality
- Many Circuits, One Mechanism: Input Variation and Evaluation Granularity in Circuit Discovery
- Finding Transformer Circuits with Edge Pruning
- Navigating by Old Maps: The Pitfalls of Static Mechanistic Localization in LLM Post-Training
- All Circuits Lead to Rome: Rethinking Functional Anisotropy in Circuit and Sheaf Discovery for LLMs
- Towards Automated Circuit Discovery for Mechanistic Interpretability
- Sparse Autoencoders Find Highly Interpretable Features in Language Models
- Intrinsically Interpretable Attention via Sparse Post-Training
- Transcoders Find Interpretable LLM Feature Circuits
- The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks
- Weight-sparse transformers have interpretable circuits
- Causal Abstractions of Neural Networks
- Localizing Model Behavior with Path Patching
- Learning both Weights and Connections for Efficient Neural Networks
- Have Faith in Faithfulness: Going Beyond Circuit Overlap When Finding Model Mechanisms
- Distilling the Knowledge in a Neural Network
- Efficient Automated Circuit Discovery in Transformers using Contextual Decomposition
- LoRA: Low-Rank Adaptation of Large Language Models
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks