Pre-training interventions, ex post facto: Grafting model beliefs across checkpoints
cs.LG, cs.AI, cs.CL
Submitted: 2026-09-30
Updated: 2026-09-30
Code: https://github.com/peternutter/grafting-beliefs
Terminology
Sources
- Persona Cartography: Charting Language Model Personality Traits in Weight Space
- Constitutional Midtraining: Content Presence Drives Alignment Gains
- Training Verifiers to Solve Math Word Problems
- "Did you lie?" Evaluating Lie Detectors across Model Scale and Belief-Verified Model Organisms
- DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
- Alignment faking in large language models
- Editing Models with Task Arithmetic
- Model Spec Midtraining: Improving How Alignment Training Generalizes
- Safety Pretraining: Toward the Next Generation of Safe AI
- Auditing language models for hidden objectives
- Negation Neglect: When models fail to learn negations in training
- Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs
- Qwen3 Technical Report
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- GIFT: Guided Fine-Tuning and Transfer for Enhancing Instruction-Tuned Language Models
- AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors
- Believe It or Not: How Deeply do LLMs Believe Implanted Facts?
- When Role-playing, Do Models Believe What They Say?
- The Model Organism Lottery: Model Organism Interpretability Strongly Depends on Training Methodology
- Olmo 3
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks