Dynamic Deep Prompt Optimization for Defending Against Jailbreak Attacks on LLMs
cs.CR, cs.AI, cs.CL
Submitted: 2026-08-10
Updated: 2026-08-10
DOI: 10.1609/aaai.v40i42.40887
Code: https://github.com/doniobidov/ddpo
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- DeepSeek LLM: Scaling Open-Source Language Models with Longtermism
- Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions
- Multilingual Jailbreak Challenges in Large Language Models
- RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment
- Gradient-based Adversarial Attacks against Text Transformers
- Baseline Defenses for Adversarial Attacks Against Aligned Language Models
- Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refinement
- DeepInception: Hypnotize Large Language Model to Be Jailbreaker
- P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks
- An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning
- HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
- SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
- AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts
- Llama 2: Open Foundation and Fine-Tuned Chat Models
- Universal Adversarial Triggers for Attacking and Analyzing NLP
- OpenChat: Advancing Open-source Language Models with Mixed-Quality Data
- GradSafe: Detecting Jailbreak Prompts for LLMs via Safety-Critical Gradient Analysis
- SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
- A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
- Jailbreak Attacks and Defenses Against Large Language Models: A Survey
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs