Staying on the Attack Path: Structured State for Long-Horizon Automated Penetration Testing
cs.CR, cs.AI
Submitted: 2026-09-07
Updated: 2026-09-18
Code: https://github.com/anmolksachan/AI-ML-Free-Resources-for-Securityand-Prompt-Injection
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Integrating DAST in Kanban and CI/CD: A Real World Security Case Study
- CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models
- CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models
- Lost in the Middle: How Language Models Use Long Contexts
- Unlocking User-oriented Pages: Intention-driven Black-box Scanner for Real-world Web Applications
- What Makes a Good LLM Agent for Real-world Penetration Testing?
- Automated Penetration Testing with LLM Agents and Classical Planning
- VulnBot: Autonomous Penetration Testing for A Multi-Agent Collaborative Framework
- APT-Agent: Automated Penetration Testing using Large Language Models
- PentestEval: Benchmarking LLM-based Penetration Testing with Modular and Stage-Level Design
- The Rise of AI Teammates in Software Engineering (SE) 3.0: How Autonomous Coding Agents Are Reshaping Software Engineering
- Pentest-R1: Towards Autonomous Penetration Testing Reasoning Optimized via Two-Stage Reinforcement Learning
- Cyber-Zero: Training Cybersecurity Agents without Runtime
- From Local to Global: A Graph RAG Approach to Query-Focused Summarization
- Measuring Real-World Prompt Injection Attacks in LLM-based Resume Screening
- Voyager: An Open-Ended Embodied Agent with Large Language Models
- DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs