Attention Sensitivity Is Not Enough: Dissociating Attention-Level and Behavioural In-Context Learning under Fine-Tuning
cs.LG, cs.AI, cs.CL
Submitted: 2026-08-30
Updated: 2026-08-30
Comments: 15 pages, 5 figures; appendices included
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Reward Shaping to Mitigate Reward Hacking in RLHF
- MiniLLM: On-Policy Distillation of Large Language Models
- Fine-Tuning Dynamics of In-Context Factual Recall in Transformers
- Inference-Time Reward Hacking in Large Language Models
- Probing Memorization of Tabular In-Context Learning
- Large Language Models Hack Rewards, and Society
- An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning
- Large Language Models Are Latent Variable Models: Explaining and Finding Good Demonstrations for In-Context Learning
- Categorizing Variants of Goodhart's Law
- ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs
- Categorical Prior Lock-in: Why In-Context Learning Fails for Structured Data
- Continual Learning of Large Language Models: A Comprehensive Survey
- Llama 2: Open Foundation and Fine-Tuned Chat Models
- Don't Go Breaking My LLM: The Impact of Pruning Attention Layers on Explanation Faithfulness and Confidence Calibration
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks