MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Xia, Yinan, Jiang, Yilei, Tan, Yingshui, Zhu, Xiaoyong, Yue, Xiangyu, Zheng, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting
por: Jiang, Yilei, et al.
Publicado: (2024)
por: Jiang, Yilei, et al.
Publicado: (2024)
HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States
por: Jiang, Yilei, et al.
Publicado: (2025)
por: Jiang, Yilei, et al.
Publicado: (2025)
QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems
por: Yang, Yiliu, et al.
Publicado: (2025)
por: Yang, Yiliu, et al.
Publicado: (2025)
Safety Alignment for Vision Language Models
por: Liu, Zhendong, et al.
Publicado: (2024)
por: Liu, Zhendong, et al.
Publicado: (2024)
ConceptGuard: Proactive Safety in Text-and-Image-to-Video Generation through Multimodal Risk Detection
por: Ma, Ruize, et al.
Publicado: (2025)
por: Ma, Ruize, et al.
Publicado: (2025)
PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment
por: Liu, Zhendong, et al.
Publicado: (2024)
por: Liu, Zhendong, et al.
Publicado: (2024)
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
por: Liu, Jianyu, et al.
Publicado: (2025)
por: Liu, Jianyu, et al.
Publicado: (2025)
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
por: Lou, Xinyue, et al.
Publicado: (2025)
por: Lou, Xinyue, et al.
Publicado: (2025)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
por: Jiang, Jiachen, et al.
Publicado: (2025)
por: Jiang, Jiachen, et al.
Publicado: (2025)
MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization
por: Zhu, Kangyu, et al.
Publicado: (2024)
por: Zhu, Kangyu, et al.
Publicado: (2024)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
por: Tan, Yingshui, et al.
Publicado: (2024)
por: Tan, Yingshui, et al.
Publicado: (2024)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
por: Wu, Yuhang, et al.
Publicado: (2024)
por: Wu, Yuhang, et al.
Publicado: (2024)
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
por: Weng, Fenghua, et al.
Publicado: (2025)
por: Weng, Fenghua, et al.
Publicado: (2025)
MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models
por: Biswas, Shristi Das, et al.
Publicado: (2026)
por: Biswas, Shristi Das, et al.
Publicado: (2026)
STAIR: Improving Safety Alignment with Introspective Reasoning
por: Zhang, Yichi, et al.
Publicado: (2025)
por: Zhang, Yichi, et al.
Publicado: (2025)
Safety Alignment in NLP Tasks: Weakly Aligned Summarization as an In-Context Attack
por: Fu, Yu, et al.
Publicado: (2023)
por: Fu, Yu, et al.
Publicado: (2023)
Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
por: Yoon, Hee Suk, et al.
Publicado: (2026)
por: Yoon, Hee Suk, et al.
Publicado: (2026)
Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models
por: Tan, Yingshui, et al.
Publicado: (2025)
por: Tan, Yingshui, et al.
Publicado: (2025)
Perception-Aware Policy Optimization for Multimodal Reasoning
por: Wang, Zhenhailong, et al.
Publicado: (2025)
por: Wang, Zhenhailong, et al.
Publicado: (2025)
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
por: Zhao, Yunhan, et al.
Publicado: (2026)
por: Zhao, Yunhan, et al.
Publicado: (2026)
Steering Multimodal Large Language Models Decoding for Context-Aware Safety
por: Liu, Zheyuan, et al.
Publicado: (2025)
por: Liu, Zheyuan, et al.
Publicado: (2025)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
por: Le, Quang-Hung, et al.
Publicado: (2024)
por: Le, Quang-Hung, et al.
Publicado: (2024)
ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails
por: Wang, Yan, et al.
Publicado: (2026)
por: Wang, Yan, et al.
Publicado: (2026)
Many-Shot Regurgitation (MSR) Prompting
por: Sonkar, Shashank, et al.
Publicado: (2024)
por: Sonkar, Shashank, et al.
Publicado: (2024)
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
por: Gu, Jihao, et al.
Publicado: (2025)
por: Gu, Jihao, et al.
Publicado: (2025)
Balancing the Reasoning Load: Difficulty-Differentiated Policy Optimization with Length Redistribution for Efficient and Robust Reinforcement Learning
por: Xia, Yinan, et al.
Publicado: (2026)
por: Xia, Yinan, et al.
Publicado: (2026)
Multimodal Cultural Safety: Evaluation Framework and Alignment Strategies
por: Qiu, Haoyi, et al.
Publicado: (2025)
por: Qiu, Haoyi, et al.
Publicado: (2025)
ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models
por: Darabi, Nastaran, et al.
Publicado: (2026)
por: Darabi, Nastaran, et al.
Publicado: (2026)
Layer-wise Alignment: Examining Safety Alignment Across Image Encoder Layers in Vision Language Models
por: Bachu, Saketh, et al.
Publicado: (2024)
por: Bachu, Saketh, et al.
Publicado: (2024)
Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreaking
por: Zhu, Junda, et al.
Publicado: (2025)
por: Zhu, Junda, et al.
Publicado: (2025)
Coherent Multimodal Reasoning with Iterative Self-Evaluation for Vision-Language Models
por: Luo, Wenjie, et al.
Publicado: (2025)
por: Luo, Wenjie, et al.
Publicado: (2025)
MR-Align: Meta-Reasoning Informed Factuality Alignment for Large Reasoning Models
por: Wang, Xinming, et al.
Publicado: (2025)
por: Wang, Xinming, et al.
Publicado: (2025)
GeoSense: Evaluating Identification and Application of Geometric Principles in Multimodal Reasoning
por: Xu, Liangyu, et al.
Publicado: (2025)
por: Xu, Liangyu, et al.
Publicado: (2025)
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
por: He, Yancheng, et al.
Publicado: (2024)
por: He, Yancheng, et al.
Publicado: (2024)
Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM
por: Tan, Chenkun, et al.
Publicado: (2025)
por: Tan, Chenkun, et al.
Publicado: (2025)
Do Vision-Language Models Really Understand Visual Language?
por: Hou, Yifan, et al.
Publicado: (2024)
por: Hou, Yifan, et al.
Publicado: (2024)
Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training
por: Yong, Zheng-Xin, et al.
Publicado: (2025)
por: Yong, Zheng-Xin, et al.
Publicado: (2025)
From Answers to Rationales: Self-Aligning Multimodal Reasoning with Answer-Oriented Chain-of-Thought
por: Tan, Wentao, et al.
Publicado: (2025)
por: Tan, Wentao, et al.
Publicado: (2025)
AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding
por: Masry, Ahmed, et al.
Publicado: (2025)
por: Masry, Ahmed, et al.
Publicado: (2025)
Towards Trustworthy Multimodal Moderation via Policy-Aligned Reasoning and Hierarchical Labeling
por: Li, Anqi, et al.
Publicado: (2025)
por: Li, Anqi, et al.
Publicado: (2025)
Ejemplares similares
-
RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting
por: Jiang, Yilei, et al.
Publicado: (2024) -
HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States
por: Jiang, Yilei, et al.
Publicado: (2025) -
QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems
por: Yang, Yiliu, et al.
Publicado: (2025) -
Safety Alignment for Vision Language Models
por: Liu, Zhendong, et al.
Publicado: (2024) -
ConceptGuard: Proactive Safety in Text-and-Image-to-Video Generation through Multimodal Risk Detection
por: Ma, Ruize, et al.
Publicado: (2025)