COGNIT-Guard: Calibrated Standalone Direct-Decision Guardrails with Heterogeneous CPU-NPU Confidence Cascading under Explicit Latency and False-Positive Constraints
cs.CR, cs.LG
Submitted: 2026-09-27
Updated: 2026-09-27
Code: https://github.com/moyuan10086/cascaded-guardrail-npu
Terminology
Sources
- SingProbe Technical Report
- Safety Beyond the Interface: Detecting Harm via Latent States in Large Language Models
- FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation
- Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations
- ShieldGemma: Generative AI Content Moderation Based on Gemma
- GLiNER Guard: Unified Encoder Family for Production LLM Safety and Privacy
- SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning
- OR-Bench: An Over-Refusal Benchmark for Large Language Models
- Exploring Complexity: An Extended Study of Formal Properties for Process Model Complexity Measures
- SafetyBench: Evaluating the Safety of Large Language Models
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs