KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards
cs.CL, cs.AI, cs.CR
Submitted: 2026-10-01
Updated: 2026-10-01
Code: https://github.com/RISys-Lab/KaliBench
Project page: https://risys-lab.github.io/KaliBench
Terminology
Sources
- Qwen3-Coder-Next Technical Report
- DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models
- GLM-5: from Vibe Coding to Agentic Engineering
- The Llama 3 Herd of Models
- LoRA: Low-Rank Adaptation of Large Language Models
- SecBench: A Comprehensive Multi-Dimensional Benchmarking Dataset for LLMs in Cybersecurity
- gpt-oss-120b & gpt-oss-20b Model Card
- Qwen2.5 Technical Report
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Gemma 3 Technical Report
- Llama-3.1-FoundationAI-SecurityLLM-8B-Instruct Technical Report
- Qwen3 Technical Report
- Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B Technical Report
- CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity
- DefenderBench: A Toolkit for Evaluating Language Agents in Cybersecurity Environments
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering