Raising the Bar for Chinese Adolescent LLM Safety: A Culturally-Grounded, Fine-Grained Benchmark
cs.CR
Submitted: 2026-09-28
Updated: 2026-09-28
Code: https://github.com/WEILaboratory/QH-Bench
Terminology
Sources
- The Age of Curiosity Meets the Age of AI: Benchmarking Child Safety in Large Language Models
- Aegis2.0: A Diverse AI Safety Dataset and Risks Taxonomy for Alignment of LLM Guardrails
- WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs
- Safe-Child-LLM: A Developmental Benchmark for Evaluating LLM Safety in Child-LLM Interactions
- MinorBench: A hand-built benchmark for content-based risks for children
- CAREBench: A Child-Safety Risk Benchmark for Language Models
- ChildEval: When large language models meet children's personalities
- HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
- ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming
- SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models
- CValues: Measuring the Values of Chinese Large Language Models from Safety to Responsibility
- YouthSafe: A Youth-Centric Safety Benchmark and Safeguard Model for Large Language Models
- ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
- CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs