Capability-Gated Language Models: Security Composes, Utility Does Not
cs.CR, cs.AI, cs.LG
Submitted: 2026-08-31
Updated: 2026-10-05
Terminology
Sources
- SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model
- Constitutional AI: Harmlessness from AI Feedback
- Do Unlearning Methods Remove Information from Language Model Weights?
- The MiniPile Challenge for Data-Efficient Language Models
- Evaluating Frontier Models for Dangerous Capabilities
- Qwen3 Technical Report
- Modular Pretraining Enables Access Control
- Model evaluation for extreme risks
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs