MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models
cs.LG, cs.CL, cs.CV, cs.SD, eess.AS
Submitted: 2026-03-03
Updated: 2026-08-31
Terminology
Sources
- PyRIT: A Framework for Security Risk Identification and Red Teaming in Generative AI System
- JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
- HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
- Jailbreaking Black Box Large Language Models in Twenty Queries
- GPT-4o System Card
- garak: A Framework for Security Probing Large Language Models
- Gemini: A Family of Highly Capable Multimodal Models
- Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack
- A StrongREJECT for Empty Jailbreaks
- WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs
- Qwen2.5-Omni Technical Report
- DeepInception: Hypnotize Large Language Model to Be Jailbreaker
- Qwen3-Omni Technical Report
- AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
- Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
- MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
- Universal and Transferable Adversarial Attacks on Aligned Language Models
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks