Compositional Safety Failures in Harness Evolution: Identification and Runtime Monitoring
cs.AI, cs.SE
Submitted: 2026-09-27
Updated: 2026-09-27
Terminology
Sources
- A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence
- Meta-Harness: End-to-End Optimization of Model Harnesses
- Position: Agentic Evolution is the Path to Evolving LLMs
- Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies
- SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment
- TTHE: Test-Time Harness Evolution
- Natural-Language Agent Harnesses
- Alita: Generalist Agent Enabling Scalable Agentic Reasoning with Minimal Predefinition and Maximal Self-Evolution
- SHE: Trajectory-driven Safety Harness Evolution for LLM Agents
- Toolformer: Language Models Can Teach Themselves to Use Tools
- The Prompt Report: A Systematic Survey of Prompt Engineering Techniques
- When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents
- Reflexion: Language Agents with Verbal Reinforcement Learning
- WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
- Voyager: An Open-Ended Embodied Agent with Large Language Models
- OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences
- Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
- Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification
- Benign Alone, Harmful Together: Exploiting Experience Composition in Self-Evolving LLM Agents
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection