SaFeR-Steer: Evolving Multi-Turn MLLMs via Synthetic Bootstrapping and Feedback Dynamics
cs.LG, cs.CL
Submitted: 2026-03-18
Updated: 2026-09-11
Comments: Accepted to EMNLP 2026. Updated to the final accepted version. Code: https://github.com/Ed-Bg/SaFeR-Steer-full
Code: https://github.com/Ed-Bg/SaFeR-Steer-full
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- Constitutional AI: Harmlessness from AI Feedback
- SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
- Exploring Typographic Visual Prompts Injection Threats in Cross-Modality Generation Models
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- GPT-4 Technical Report
- Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message
- MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
- Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
- Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning
- JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
- Dialogue Injection Attack: Jailbreaking LLMs through Context Manipulation
- OpenAI o1 System Card
- Invisible Injections: Exploiting Vision-Language Models Through Steganographic Prompt Embedding
- Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
- Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback
- LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- OpenAI GPT-5 System Card
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks