AM$^3$Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Han, Chen, Jiale, Cai, Chengkun, Sun, Shengjie, Li, Haoran, Zhou, Yujin, Chan, Chi-Min, Wen, Pengcheng, Li, Lei, Han, Sirui, Guo, Yike |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SafeMT: Multi-turn Safety for Multimodal Language Models
di: Zhu, Han, et al.
Pubblicazione: (2025)
di: Zhu, Han, et al.
Pubblicazione: (2025)
Not Just the Destination, But the Journey: Reasoning Traces Causally Shape Generalization Behaviors
di: Wen, Pengcheng, et al.
Pubblicazione: (2026)
di: Wen, Pengcheng, et al.
Pubblicazione: (2026)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement Learning
di: Bai, Hongbo, et al.
Pubblicazione: (2026)
di: Bai, Hongbo, et al.
Pubblicazione: (2026)
MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming
di: Guo, Weiyang, et al.
Pubblicazione: (2025)
di: Guo, Weiyang, et al.
Pubblicazione: (2025)
What, Whether and How? Unveiling Process Reward Models for Thinking with Images Reasoning
di: Zhou, Yujin, et al.
Pubblicazione: (2026)
di: Zhou, Yujin, et al.
Pubblicazione: (2026)
ThinkPatterns-21k: A Systematic Study on the Impact of Thinking Patterns in LLMs
di: Wen, Pengcheng, et al.
Pubblicazione: (2025)
di: Wen, Pengcheng, et al.
Pubblicazione: (2025)
Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs
di: Wen, Ming, et al.
Pubblicazione: (2026)
di: Wen, Ming, et al.
Pubblicazione: (2026)
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning
di: Chen, Renmiao, et al.
Pubblicazione: (2026)
di: Chen, Renmiao, et al.
Pubblicazione: (2026)
The Forgotten Shield: Safety Grafting in Parameter-Space for Medical MLLMs
di: Zhao, Jiale, et al.
Pubblicazione: (2025)
di: Zhao, Jiale, et al.
Pubblicazione: (2025)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
di: Chen, Jianhui, et al.
Pubblicazione: (2024)
di: Chen, Jianhui, et al.
Pubblicazione: (2024)
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
di: Zhou, Jiayi, et al.
Pubblicazione: (2025)
di: Zhou, Jiayi, et al.
Pubblicazione: (2025)
State-Dependent Safety Failures in Multi-Turn Language Model Interaction
di: Li, Pengcheng, et al.
Pubblicazione: (2026)
di: Li, Pengcheng, et al.
Pubblicazione: (2026)
J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge
di: Chan, Chi-Min, et al.
Pubblicazione: (2025)
di: Chan, Chi-Min, et al.
Pubblicazione: (2025)
HKGAI-V1: Towards Regional Sovereign Large Language Model for Hong Kong
di: Han, Sirui, et al.
Pubblicazione: (2025)
di: Han, Sirui, et al.
Pubblicazione: (2025)
Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
di: Yang, Junxiao, et al.
Pubblicazione: (2026)
di: Yang, Junxiao, et al.
Pubblicazione: (2026)
CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs
di: Liu, Yuxuan, et al.
Pubblicazione: (2026)
di: Liu, Yuxuan, et al.
Pubblicazione: (2026)
LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories
di: Sun, Qianpu, et al.
Pubblicazione: (2026)
di: Sun, Qianpu, et al.
Pubblicazione: (2026)
From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities
di: Jiang, Shixin, et al.
Pubblicazione: (2024)
di: Jiang, Shixin, et al.
Pubblicazione: (2024)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety
di: Song, Jialin, et al.
Pubblicazione: (2026)
di: Song, Jialin, et al.
Pubblicazione: (2026)
Rethinking Patient Education as Multi-turn Multi-modal Interaction
di: Yao, Zonghai, et al.
Pubblicazione: (2026)
di: Yao, Zonghai, et al.
Pubblicazione: (2026)
ContextLens: Modeling Imperfect Privacy and Safety Context for Legal Compliance
di: Li, Haoran, et al.
Pubblicazione: (2026)
di: Li, Haoran, et al.
Pubblicazione: (2026)
SafeLawBench: Towards Safe Alignment of Large Language Models
di: Cao, Chuxue, et al.
Pubblicazione: (2025)
di: Cao, Chuxue, et al.
Pubblicazione: (2025)
Benchmarking Multi-National Value Alignment for Large Language Models
di: Shi, Weijie, et al.
Pubblicazione: (2025)
di: Shi, Weijie, et al.
Pubblicazione: (2025)
SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
di: Li, Hao, et al.
Pubblicazione: (2026)
di: Li, Hao, et al.
Pubblicazione: (2026)
CRAG-MM: Multi-modal Multi-turn Comprehensive RAG Benchmark
di: Wang, Jiaqi, et al.
Pubblicazione: (2025)
di: Wang, Jiaqi, et al.
Pubblicazione: (2025)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
di: Zhang, Bob, et al.
Pubblicazione: (2025)
di: Zhang, Bob, et al.
Pubblicazione: (2025)
Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment
di: Song, Zhixue, et al.
Pubblicazione: (2026)
di: Song, Zhixue, et al.
Pubblicazione: (2026)
GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners
di: Li, Haoran, et al.
Pubblicazione: (2025)
di: Li, Haoran, et al.
Pubblicazione: (2025)
Reimagining Legal Fact Verification with GenAI: Toward Effective Human-AI Collaboration
di: Han, Sirui, et al.
Pubblicazione: (2026)
di: Han, Sirui, et al.
Pubblicazione: (2026)
DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt
di: Zhang, Yitong, et al.
Pubblicazione: (2025)
di: Zhang, Yitong, et al.
Pubblicazione: (2025)
Multi-Prompt Alignment for Multi-Source Unsupervised Domain Adaptation
di: Chen, Haoran, et al.
Pubblicazione: (2022)
di: Chen, Haoran, et al.
Pubblicazione: (2022)
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
di: Lou, Xinyue, et al.
Pubblicazione: (2025)
di: Lou, Xinyue, et al.
Pubblicazione: (2025)
Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check
di: Cao, Chentao, et al.
Pubblicazione: (2025)
di: Cao, Chentao, et al.
Pubblicazione: (2025)
Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction
di: Shu, Bao, et al.
Pubblicazione: (2025)
di: Shu, Bao, et al.
Pubblicazione: (2025)
Global Tropical Cyclone Intensity Forecasting with Multi-modal Multi-scale Causal Autoregressive Model
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models?
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SafeMT: Multi-turn Safety for Multimodal Language Models
di: Zhu, Han, et al.
Pubblicazione: (2025) -
Not Just the Destination, But the Journey: Reasoning Traces Causally Shape Generalization Behaviors
di: Wen, Pengcheng, et al.
Pubblicazione: (2026) -
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
di: Ji, Jiaming, et al.
Pubblicazione: (2024) -
Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement Learning
di: Bai, Hongbo, et al.
Pubblicazione: (2026) -
MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming
di: Guo, Weiyang, et al.
Pubblicazione: (2025)