The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs
cs.LG, cs.AI, cs.CL
Submitted: 2025-11-25
Updated: 2026-09-26
Code: https://github.com/thecraigd/emergent-misalignment
Terminology
Sources
- Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMs
- Is Quantization a Deal-breaker? Empirical Insights from Large Code Models
- Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs
- An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks
- Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models
- DeepSeek LLM: Scaling Open-Source Language Models with Longtermism
- Moloch's Bargain: Emergent Misalignment When LLMs Compete for Audiences
- Fine-Tuning Lowers Safety and Disrupts Evaluation Consistency
- Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models
- LoRA: Low-Rank Adaptation of Large Language Models
- Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings
- Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training
- A Comprehensive Evaluation of Quantization Strategies for Large Language Models
- In-Training Defenses against Emergent Misalignment in Language Models
- Scaling Laws for Forgetting When Fine-Tuning Large Language Models
- A Comprehensive Study on Quantization Techniques for Large Language Models
- LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B
- Revisiting Catastrophic Forgetting in Large Language Model Tuning
- Evaluating Quantized Large Language Models
- An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks