RECEIPT: Deterministic, Reward-Hacking-Resistant Verification for White-Box Agentic XSS Discovery
Muxi Lyu, Karen Shieh, Yiwei Hou, Hao Wang, Koushik Sen, David Wagner
cs.CR
Submitted: 2026-07-20
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- LLM Agents can Autonomously Exploit One-day Vulnerabilities
- EnIGMA: Interactive Tools Substantially Assist LM Agents in Finding Security Vulnerabilities
- LLM Agents can Autonomously Hack Websites
- Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases
- Defining and Characterizing Reward Hacking
- Natural Emergent Misalignment from Reward Hacking in Production RL
- Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models
- CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale
- Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation
- Establishing Best Practices for Building Rigorous Agentic Benchmarks
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs