CoDeL: Co-Evolutionary Defense against Indirect Prompt Injection in LLM-based Agents
cs.CR, cs.AI
Submitted: 2026-09-28
Updated: 2026-09-28
Terminology
Sources
- Constitutional AI: Harmlessness from AI Feedback
- StruQ: Defending Against Prompt Injection with Structured Queries
- Meta-SecAlign: Training LLMs against Prompt Injection for Robust Agents
- ShieldAgent: Shielding Agents via Verifiable Safety Policy Reasoning
- RainbowPlus: Enhancing Adversarial Prompt Generation via Evolutionary Quality-Diversity Search
- WASP: Benchmarking Web Agent Security Against Prompt Injection Attacks
- DiscourseFlip: An Oblique Discourse-Level Opinion Manipulation Attack against Black-box Retrieval-Augmented Generation
- LocalAlign: Enabling Generalizable Prompt Injection Defense via Generation of Near-Target Adversarial Examples for Alignment Training
- LoRA: Low-Rank Adaptation of Large Language Models
- ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack
- GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
- AgentBench: Evaluating LLMs as Agents
- AutoDojo: A Generative Benchmark for Evaluating Prompt Injection Defenses in LLM Agents
- Toolformer: Language Models Can Teach Themselves to Use Tools
- ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM Agents
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- PromptArmor: Simple yet Effective Prompt Injection Defenses
- GPT-Red: Automated Red Teaming via Self-Play at Scale
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs