FuzzingBrain-Bench V1: Evaluating Open-Ended Bug Discovery by LLMs
cs.AI, cs.CR, cs.LG, cs.SE
Submitted: 2026-08-25
Updated: 2026-08-25
Code: https://github.com/fuzzingbrain/FuzzingBrain-Bench
Terminology
Sources
- SecVulEval: Benchmarking LLMs for Real-World C/C++ Vulnerability Detection
- SEC-bench: Automated Benchmarking of LLM Agents on Real-World Software Security Tasks
- IRIS: LLM-Assisted Static Analysis for Detecting Security Vulnerabilities
- VulDetectBench: Evaluating the Deep Capability of Vulnerability Detection with Large Language Models
- Enhancing Reverse Engineering: Investigating and Benchmarking Large Language Models for Vulnerability Analysis in Decompiled Binaries
- LProtector: An LLM-driven Vulnerability Detection System
- All You Need Is A Fuzzing Brain: An LLM-Powered System for Automated Vulnerability Detection and Patching
- FuzzingBrain V2: A Multi-Agent LLM System for Automated Vulnerability Discovery and Reproduction
- Quality-Assured Fuzz Harness Generation via the Four Principles Framework
- CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale
- A Systematic Study of LLM-Based Architectures for Automated Patching
- D2A: A Dataset Built for AI-Based Vulnerability Detection Methods Using Differential Analysis
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection