SafeCommit: Certifying When Memory-Grounded Agents May Safely Act
Mayur Akewar, Ravi Ranjan
cs.AI, cs.CL
Submitted: 2026-08-04
Comments: 14 pages, 6 tables, and 1 figure, target NeurIPS
Code: https://github.com/akewarmayur/SafeCommit
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- AgentGuardian: Learning Access Control Policies to Govern AI Agent Behavior
- Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety
- AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
- Memory Injection Attacks on LLM Agents via Query-Only Interaction
- Embodied Foundation Models at the Edge: A Survey of Deployment Constraints and Mitigation Strategies
- Active Task Disambiguation with LLMs
- VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- CatRAG: Functor-Guided Structural Debiasing with Retrieval Augmentation for Fair LLMs
- G-Drift MIA: Membership Inference via Gradient-Induced Feature Drift in LLMs
- Listening with Attention: Entropy-Guided Explainability for Transformer-Based Audio Models
- PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs
- RAZOR: Ratio-Aware Layer Editing for Targeted Unlearning in Vision Transformers and Diffusion Models
- Position: LLMs Must Use Functor-Based and RAG-Driven Bias Mitigation for Fairness
- Identifying the Risks of LM Agents with an LM-Emulated Sandbox
- Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents
- Structured Uncertainty guided Clarification for LLM Agents
- A-MEM: Agentic Memory for LLM Agents
- Agentic Uncertainty Quantification
- Don't Let AI Agents YOLO Your Files: Shifting Information and Control to Filesystems for Agent Safety and Autonomy
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection