Safe Semantics, Unsafe Interpretations: Tackling Implicit Reasoning Safety in Large Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Cai, Wei, Zhao, Jian, Jiang, Yuchu, Zhang, Tianle, Li, Xuelong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models
por: Cai, Wei, et al.
Publicado: (2025)
por: Cai, Wei, et al.
Publicado: (2025)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
por: Wang, Siyin, et al.
Publicado: (2024)
por: Wang, Siyin, et al.
Publicado: (2024)
ClawSafety: "Safe" LLMs, Unsafe Agents
por: Wei, Bowen, et al.
Publicado: (2026)
por: Wei, Bowen, et al.
Publicado: (2026)
Visual Attention Reasoning via Hierarchical Search and Self-Verification
por: Cai, Wei, et al.
Publicado: (2025)
por: Cai, Wei, et al.
Publicado: (2025)
SafeRBench: Dissecting the Reasoning Safety of Large Language Models
por: Gao, Xin, et al.
Publicado: (2025)
por: Gao, Xin, et al.
Publicado: (2025)
Safe Vision-Language Models via Unsafe Weights Manipulation
por: D'Incà, Moreno, et al.
Publicado: (2025)
por: D'Incà, Moreno, et al.
Publicado: (2025)
Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model
por: Li, Tianle, et al.
Publicado: (2025)
por: Li, Tianle, et al.
Publicado: (2025)
ERF-BA-TFD+: A Multimodal Model for Audio-Visual Deepfake Detection
por: Zhang, Xin, et al.
Publicado: (2025)
por: Zhang, Xin, et al.
Publicado: (2025)
Probing the Safety Response Boundary of Large Language Models via Unsafe Decoding Path Generation
por: Wang, Haoyu, et al.
Publicado: (2024)
por: Wang, Haoyu, et al.
Publicado: (2024)
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
por: Ning, Zhiyuan, et al.
Publicado: (2025)
por: Ning, Zhiyuan, et al.
Publicado: (2025)
Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs
por: Jiang, Yukun, et al.
Publicado: (2026)
por: Jiang, Yukun, et al.
Publicado: (2026)
HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios
por: Pu, Jiayue, et al.
Publicado: (2026)
por: Pu, Jiayue, et al.
Publicado: (2026)
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
por: Zhang, Borong, et al.
Publicado: (2025)
por: Zhang, Borong, et al.
Publicado: (2025)
SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities
por: Jiang, Fengqing, et al.
Publicado: (2025)
por: Jiang, Fengqing, et al.
Publicado: (2025)
Gradient Co-occurrence Analysis for Detecting Unsafe Prompts in Large Language Models
por: Yang, Jingyuan, et al.
Publicado: (2025)
por: Yang, Jingyuan, et al.
Publicado: (2025)
Loupe: A Generalizable and Adaptive Framework for Image Forgery Detection
por: Jiang, Yuchu, et al.
Publicado: (2025)
por: Jiang, Yuchu, et al.
Publicado: (2025)
Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities
por: Qu, Yiting, et al.
Publicado: (2025)
por: Qu, Yiting, et al.
Publicado: (2025)
Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection
por: Fu, Jinhu, et al.
Publicado: (2026)
por: Fu, Jinhu, et al.
Publicado: (2026)
SR-FoT: A Syllogistic-Reasoning Framework of Thought for Large Language Models Tackling Knowledge-based Reasoning Tasks
por: Wan, Wentao, et al.
Publicado: (2025)
por: Wan, Wentao, et al.
Publicado: (2025)
LionGuard: Building a Contextualized Moderation Classifier to Tackle Localized Unsafe Content
por: Foo, Jessica, et al.
Publicado: (2024)
por: Foo, Jessica, et al.
Publicado: (2024)
SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond
por: Zhu, Xiangyang, et al.
Publicado: (2026)
por: Zhu, Xiangyang, et al.
Publicado: (2026)
RxSafeBench: Identifying Medication Safety Issues of Large Language Models in Simulated Consultation
por: Zhao, Jiahao, et al.
Publicado: (2025)
por: Zhao, Jiahao, et al.
Publicado: (2025)
From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models
por: Dai, Muzhi, et al.
Publicado: (2025)
por: Dai, Muzhi, et al.
Publicado: (2025)
Implicit Reasoning in Large Language Models: A Comprehensive Survey
por: Li, Jindong, et al.
Publicado: (2025)
por: Li, Jindong, et al.
Publicado: (2025)
Comparing Human and Large Language Model Interpretation of Implicit Information
por: De Santis, Antonio, et al.
Publicado: (2026)
por: De Santis, Antonio, et al.
Publicado: (2026)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
por: Fang, Junfeng, et al.
Publicado: (2025)
por: Fang, Junfeng, et al.
Publicado: (2025)
Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models
por: Lyu, Zesen, et al.
Publicado: (2025)
por: Lyu, Zesen, et al.
Publicado: (2025)
Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning
por: Luo, Linhao, et al.
Publicado: (2023)
por: Luo, Linhao, et al.
Publicado: (2023)
Membership Inference for Contrastive Pre-training Models with Text-only PII Queries
por: Cheng, Ruoxi, et al.
Publicado: (2026)
por: Cheng, Ruoxi, et al.
Publicado: (2026)
Safe-Support Q-Learning: Learning without Unsafe Exploration
por: Lim, Yeeun, et al.
Publicado: (2026)
por: Lim, Yeeun, et al.
Publicado: (2026)
Towards Automated Semantic Interpretability in Reinforcement Learning via Vision-Language Models
por: Li, Zhaoxin, et al.
Publicado: (2025)
por: Li, Zhaoxin, et al.
Publicado: (2025)
Enhance Vision-Language Alignment with Noise
por: Huang, Sida, et al.
Publicado: (2024)
por: Huang, Sida, et al.
Publicado: (2024)
Multimodal Large Language Model Framework for Safe and Interpretable Grid-Integrated EVs
por: Carvalho, Jean Douglas, et al.
Publicado: (2025)
por: Carvalho, Jean Douglas, et al.
Publicado: (2025)
HoliSafe: Holistic Safety Benchmarking and Modeling for Vision-Language Model
por: Lee, Youngwan, et al.
Publicado: (2025)
por: Lee, Youngwan, et al.
Publicado: (2025)
Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models
por: Gu, Zheyuan, et al.
Publicado: (2026)
por: Gu, Zheyuan, et al.
Publicado: (2026)
Fast Large Language Model Collaborative Decoding via Speculation
por: Fu, Jiale, et al.
Publicado: (2025)
por: Fu, Jiale, et al.
Publicado: (2025)
Aetheria: A multimodal interpretable content safety framework based on multi-agent debate and collaboration
por: He, Yuxiang, et al.
Publicado: (2025)
por: He, Yuxiang, et al.
Publicado: (2025)
REMA: A Unified Reasoning Manifold Framework for Interpreting Large Language Model
por: Li, Bo, et al.
Publicado: (2025)
por: Li, Bo, et al.
Publicado: (2025)
SafeMT: Multi-turn Safety for Multimodal Language Models
por: Zhu, Han, et al.
Publicado: (2025)
por: Zhu, Han, et al.
Publicado: (2025)
Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models
por: Che, Liwei, et al.
Publicado: (2026)
por: Che, Liwei, et al.
Publicado: (2026)
Ejemplares similares
-
When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models
por: Cai, Wei, et al.
Publicado: (2025) -
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
por: Wang, Siyin, et al.
Publicado: (2024) -
ClawSafety: "Safe" LLMs, Unsafe Agents
por: Wei, Bowen, et al.
Publicado: (2026) -
Visual Attention Reasoning via Hierarchical Search and Self-Verification
por: Cai, Wei, et al.
Publicado: (2025) -
SafeRBench: Dissecting the Reasoning Safety of Large Language Models
por: Gao, Xin, et al.
Publicado: (2025)