Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and Safety Judges
cs.CR, cs.AI
Submitted: 2026-09-01
Updated: 2026-09-11
Code: https://github.com/SparkShieldLab/C-SafeQA
Terminology
Sources
- Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs
- Safety Assessment of Chinese Large Language Models
- CValues: Measuring the Values of Chinese Large Language Models from Safety to Responsibility
- CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
- ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
- Universal and Transferable Adversarial Attacks on Aligned Language Models
- HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
- Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations
- Qwen3Guard Technical Report
- OR-Bench: An Over-Refusal Benchmark for Large Language Models
- JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework
- YuFeng-XGuard: A Reasoning-Centric, Interpretable, and Flexible Guardrail Model for Large Language Models
- Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation
- HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment
- A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness
- BabelSafe: A Policy-Grounded Multilingual Safety Benchmark for LLMs
- GUARD: Role-playing to Generate Natural-language Jailbreakings to Test Guideline Adherence of Large Language Models
- ChineseHarm-Bench: A Chinese Harmful Content Detection Benchmark
- SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
- CSSBench: Evaluating the Safety of Lightweight LLMs against Chinese-Specific Adversarial Patterns
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs