Granite.Trust Policy Tools: Shareable, Actionable Policies for Generative AI Applications
cs.AI
Submitted: 2026-08-24
Updated: 2026-08-24
Code: https://github.com/ibm-granite/granite.trust.policy-tools
Project page: https://ibm.github.io/fms-dgt
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- AI Risk Atlas: Taxonomy and Tooling for Navigating AI Risks and Resources
- Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback
- Constitutional AI: Harmlessness from AI Feedback
- Improved Supervised Fine-Tuning for Large Language Models to Mitigate Catastrophic Forgetting
- The Unified Control Framework: Establishing a Common Foundation for Enterprise AI Governance, Risk Management and Regulatory Compliance
- Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics
- Activated LoRA: Fine-tuned LLMs for Intrinsics
- Unveiling Safety Vulnerabilities of Large Language Models
- Tulu 3: Pushing Frontiers in Open Language Model Post-Training
- Synthetic Data (Almost) from Scratch: Generalized Instruction Tuning for Language Models
- Rethinking Machine Unlearning for Large Language Models
- PyRIT: A Framework for Security Risk Identification and Red Teaming in Generative AI System
- Granite Guardian
- Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!
- The AI risk repository: A meta-review, database, and taxonomy of risks from artificial intelligence
- Invariance Makes LLM Unlearning Resilient Even to Unanticipated Downstream Fine-Tuning
- MAP: Multi-Human-Value Alignment Palette
- Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing
- AI Risk Categorization Decoded (AIR 2024): From Government Regulations to Corporate Policies
- AIR-Bench 2024: A Safety Benchmark Based on Risk Categories from Regulations and Policies
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection