Phantom Guardrails: When Self-Improving Agent Harnesses Fix Failures That Never Happened
Su Wang, Pin Qian, Yifan Lin, Jingzhou Xu, Yihang Chen, Xiaochong Jiang, Lifei Liu, Haoran Yu
cs.CR, cs.SE
Submitted: 2026-07-13
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization
- Meta-Harness: End-to-End Optimization of Model Harnesses
- Analysing Chain of Thought Dynamics: Active Guidance or Unfaithful Post-hoc Rationalisation?
- SafetyRepro: Configuration-Conditional Rank Instability on Alignment Benchmarks
- Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
- Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection
- You Cannot Fix What You Cannot Find! An Investigation of Fault Localization Bias in Benchmarking Automated Program Repair Systems
- AutoHarness: improving LLM agents by automatically synthesizing a code harness
- Categorizing Variants of Goodhart's Law
- Code as Agent Harness
- Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference
- Defining and Characterizing Reward Hacking
- LLM Agents Already Know When to Call Tools -- Even Without Reasoning
- Beyond Accuracy: Measuring Bias Acknowledgment in Chain-of-Thought Reasoning for Responsible AI Evaluation
- VeRO: A Harness for Agents to Optimize Agents
- The Observability Gap: Why Output-Level Human Feedback Fails for LLM Coding Agents
- Adapting the Interface, Not the Model: Runtime Harness Adaptation for Deterministic LLM Agents
- PAFT: Preservation Aware Fine-Tuning for Minimal-Edit Program Repair
- Reward Auditor: Inference on Reward Modeling Suitability in Real-World Perturbed Scenarios
- OR-Bench: An Over-Refusal Benchmark for Large Language Models
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs