SafeMT: Multi-turn Safety for Multimodal Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Han, Dai, Juntao, Ji, Jiaming, Li, Haoran, Cai, Chengkun, Wen, Pengcheng, Chan, Chi-Min, Chen, Boyuan, Yang, Yaodong, Han, Sirui, Guo, Yike |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AM$^3$Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs
di: Zhu, Han, et al.
Pubblicazione: (2026)
di: Zhu, Han, et al.
Pubblicazione: (2026)
ThinkPatterns-21k: A Systematic Study on the Impact of Thinking Patterns in LLMs
di: Wen, Pengcheng, et al.
Pubblicazione: (2025)
di: Wen, Pengcheng, et al.
Pubblicazione: (2025)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
SafeLawBench: Towards Safe Alignment of Large Language Models
di: Cao, Chuxue, et al.
Pubblicazione: (2025)
di: Cao, Chuxue, et al.
Pubblicazione: (2025)
When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal Reasoning
di: Fang, Sitong, et al.
Pubblicazione: (2025)
di: Fang, Sitong, et al.
Pubblicazione: (2025)
InterMT: Multi-Turn Interleaved Preference Alignment with Human Feedback
di: Chen, Boyuan, et al.
Pubblicazione: (2025)
di: Chen, Boyuan, et al.
Pubblicazione: (2025)
J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge
di: Chan, Chi-Min, et al.
Pubblicazione: (2025)
di: Chan, Chi-Min, et al.
Pubblicazione: (2025)
What, Whether and How? Unveiling Process Reward Models for Thinking with Images Reasoning
di: Zhou, Yujin, et al.
Pubblicazione: (2026)
di: Zhou, Yujin, et al.
Pubblicazione: (2026)
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
di: Zhou, Jiayi, et al.
Pubblicazione: (2025)
di: Zhou, Jiayi, et al.
Pubblicazione: (2025)
Mitigating Deceptive Alignment via Self-Monitoring
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
Not Just the Destination, But the Journey: Reasoning Traces Causally Shape Generalization Behaviors
di: Wen, Pengcheng, et al.
Pubblicazione: (2026)
di: Wen, Pengcheng, et al.
Pubblicazione: (2026)
Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement Learning
di: Bai, Hongbo, et al.
Pubblicazione: (2026)
di: Bai, Hongbo, et al.
Pubblicazione: (2026)
SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning
di: Wang, Lichao, et al.
Pubblicazione: (2026)
di: Wang, Lichao, et al.
Pubblicazione: (2026)
Safety-Gymnasium: A Unified Safe Reinforcement Learning Benchmark
di: Ji, Jiaming, et al.
Pubblicazione: (2023)
di: Ji, Jiaming, et al.
Pubblicazione: (2023)
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
di: Zhang, Borong, et al.
Pubblicazione: (2025)
di: Zhang, Borong, et al.
Pubblicazione: (2025)
Benchmarking Multi-National Value Alignment for Large Language Models
di: Shi, Weijie, et al.
Pubblicazione: (2025)
di: Shi, Weijie, et al.
Pubblicazione: (2025)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
SafeEditor: Unified MLLM for Efficient Post-hoc T2I Safety Editing
di: Zhang, Ruiyang, et al.
Pubblicazione: (2025)
di: Zhang, Ruiyang, et al.
Pubblicazione: (2025)
Perception, Understanding and Reasoning, A Multimodal Benchmark for Video Fake News Detection
di: Yakun, Cui, et al.
Pubblicazione: (2025)
di: Yakun, Cui, et al.
Pubblicazione: (2025)
Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation
di: Dai, Juntao, et al.
Pubblicazione: (2024)
di: Dai, Juntao, et al.
Pubblicazione: (2024)
SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset
di: Dai, Josef, et al.
Pubblicazione: (2024)
di: Dai, Josef, et al.
Pubblicazione: (2024)
Measuring Hong Kong Massive Multi-Task Language Understanding
di: Cao, Chuxue, et al.
Pubblicazione: (2025)
di: Cao, Chuxue, et al.
Pubblicazione: (2025)
SafeDreamer: Safe Reinforcement Learning with World Models
di: Huang, Weidong, et al.
Pubblicazione: (2023)
di: Huang, Weidong, et al.
Pubblicazione: (2023)
Aligner: Efficient Alignment by Learning to Correct
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment
di: Chen, Jiawei, et al.
Pubblicazione: (2026)
di: Chen, Jiawei, et al.
Pubblicazione: (2026)
A Game-Theoretic Negotiation Framework for Cross-Cultural Consensus in LLMs
di: Zhang, Guoxi, et al.
Pubblicazione: (2025)
di: Zhang, Guoxi, et al.
Pubblicazione: (2025)
HKGAI-V1: Towards Regional Sovereign Large Language Model for Hong Kong
di: Han, Sirui, et al.
Pubblicazione: (2025)
di: Han, Sirui, et al.
Pubblicazione: (2025)
Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models
di: Fang, Sitong, et al.
Pubblicazione: (2025)
di: Fang, Sitong, et al.
Pubblicazione: (2025)
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
di: Lou, Hantao, et al.
Pubblicazione: (2025)
di: Lou, Hantao, et al.
Pubblicazione: (2025)
MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models
di: Yang, Tianzhuo, et al.
Pubblicazione: (2026)
di: Yang, Tianzhuo, et al.
Pubblicazione: (2026)
Language Models Resist Alignment: Evidence From Data Compression
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
MedInsightBench: Evaluating Medical Analytics Agents Through Multi-Step Insight Discovery in Multimodal Medical Data
di: Zhu, Zhenghao, et al.
Pubblicazione: (2025)
di: Zhu, Zhenghao, et al.
Pubblicazione: (2025)
Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment
di: Bu, Yuyan, et al.
Pubblicazione: (2026)
di: Bu, Yuyan, et al.
Pubblicazione: (2026)
LegalReasoner: Step-wised Verification-Correction for Legal Judgment Reasoning
di: Shi, Weijie, et al.
Pubblicazione: (2025)
di: Shi, Weijie, et al.
Pubblicazione: (2025)
Enhance the Safety in Reinforcement Learning by ADRC Lagrangian Methods
di: Zhang, Mingxu, et al.
Pubblicazione: (2026)
di: Zhang, Mingxu, et al.
Pubblicazione: (2026)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
di: Zhang, Borong, et al.
Pubblicazione: (2025)
di: Zhang, Borong, et al.
Pubblicazione: (2025)
DC-W2S: Dual-Consensus Weak-to-Strong Training for Reliable Process Reward Modeling in Biological Reasoning
di: Chan, Chi-Min, et al.
Pubblicazione: (2026)
di: Chan, Chi-Min, et al.
Pubblicazione: (2026)
Towards Advanced Mathematical Reasoning for LLMs via First-Order Logic Theorem Proving
di: Cao, Chuxue, et al.
Pubblicazione: (2025)
di: Cao, Chuxue, et al.
Pubblicazione: (2025)
Automate Strategy Finding with LLM in Quant Investment
di: Kou, Zhizhuo, et al.
Pubblicazione: (2024)
di: Kou, Zhizhuo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
AM$^3$Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs
di: Zhu, Han, et al.
Pubblicazione: (2026) -
ThinkPatterns-21k: A Systematic Study on the Impact of Thinking Patterns in LLMs
di: Wen, Pengcheng, et al.
Pubblicazione: (2025) -
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
di: Ji, Jiaming, et al.
Pubblicazione: (2024) -
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
di: Ji, Jiaming, et al.
Pubblicazione: (2025) -
SafeLawBench: Towards Safe Alignment of Large Language Models
di: Cao, Chuxue, et al.
Pubblicazione: (2025)