CyberPersistBench: Evaluating LLM-Based Cyber Attackers on Installation and Persistence
cs.CR
Submitted: 2026-09-29
Updated: 2026-09-29
Code: https://github.com/UKGovernmentBEIS/inspect
Terminology
Sources
- CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models
- Evaluating Large Language Models Trained on Code
- DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
- GLM-5: from Vibe Coding to Agentic Engineering
- OCCULT: Evaluating Large Language Models for Offensive Cyber Operation Capabilities
- AgentCyberRange: Benchmarking Frontier AI Systems in Realistic Cyber Ranges
- A Survey on Agentic Security: Applications, Threats and Defenses
- ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?
- ReAct: Synergizing Reasoning and Acting in Language Models
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs