When Helpers Become Hazards: A Benchmark for Analyzing Multimodal LLM-Powered Safety in Daily Life
Fuente:
arXiv
Saved in:
| Main Authors: | Lou, Xinyue, Xu, Jinan, Yin, Jingyi, Wang, Xiaolong, Kang, Zhaolu, Liao, Youwei, Wang, Yixuan, Shi, Xiangyu, Mo, Fengran, Yao, Su, Huang, Kaiyu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
by: Lou, Xinyue, et al.
Published: (2025)
by: Lou, Xinyue, et al.
Published: (2025)
MUCAR: Benchmarking Multilingual Cross-Modal Ambiguity Resolution for Multimodal Large Language Models
by: Wang, Xiaolong, et al.
Published: (2025)
by: Wang, Xiaolong, et al.
Published: (2025)
DoRA: Enhancing Parameter-Efficient Fine-Tuning with Dynamic Rank Distribution
by: Mao, Yulong, et al.
Published: (2024)
by: Mao, Yulong, et al.
Published: (2024)
Multilingual Collaborative Defense for Large Language Models
by: Li, Hongliang, et al.
Published: (2025)
by: Li, Hongliang, et al.
Published: (2025)
SoT: Structured-of-Thought Prompting Guides Multilingual Reasoning in Large Language Models
by: Qi, Rui, et al.
Published: (2025)
by: Qi, Rui, et al.
Published: (2025)
TransportationGames: Benchmarking Transportation Knowledge of (Multimodal) Large Language Models
by: Zhang, Xue, et al.
Published: (2024)
by: Zhang, Xue, et al.
Published: (2024)
OmniGeo: Towards a Multimodal Large Language Models for Geospatial Artificial Intelligence
by: Yuan, Long, et al.
Published: (2025)
by: Yuan, Long, et al.
Published: (2025)
Boosting Data Utilization for Multilingual Dense Retrieval
by: Huang, Chao, et al.
Published: (2025)
by: Huang, Chao, et al.
Published: (2025)
Language-Coupled Reinforcement Learning for Multilingual Retrieval-Augmented Generation
by: Qi, Rui, et al.
Published: (2026)
by: Qi, Rui, et al.
Published: (2026)
AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions
by: Ying, Zonghao, et al.
Published: (2025)
by: Ying, Zonghao, et al.
Published: (2025)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
by: Liu, Zheyuan, et al.
Published: (2026)
by: Liu, Zheyuan, et al.
Published: (2026)
LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks
by: Gao, Hengjian, et al.
Published: (2026)
by: Gao, Hengjian, et al.
Published: (2026)
CroSearch-R1: Better Leveraging Cross-lingual Knowledge for Retrieval-Augmented Generation
by: Qi, Rui, et al.
Published: (2026)
by: Qi, Rui, et al.
Published: (2026)
ConvSDG: Session Data Generation for Conversational Search
by: Mo, Fengran, et al.
Published: (2024)
by: Mo, Fengran, et al.
Published: (2024)
ConvGQR: Generative Query Reformulation for Conversational Search
by: Mo, Fengran, et al.
Published: (2023)
by: Mo, Fengran, et al.
Published: (2023)
How to Leverage Personal Textual Knowledge for Personalized Conversational Information Retrieval
by: Mo, Fengran, et al.
Published: (2024)
by: Mo, Fengran, et al.
Published: (2024)
CSMD: Curated Multimodal Dataset for Chinese Stock Analysis
by: Liu, Yu, et al.
Published: (2025)
by: Liu, Yu, et al.
Published: (2025)
WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Models
by: Yu, Yongan, et al.
Published: (2025)
by: Yu, Yongan, et al.
Published: (2025)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
by: Luo, Fuwen, et al.
Published: (2024)
by: Luo, Fuwen, et al.
Published: (2024)
Penny Wise, Pixel Foolish: Bypassing Price Constraints in Multimodal Agents via Visual Adversarial Perturbations
by: Qian, Jiachen, et al.
Published: (2026)
by: Qian, Jiachen, et al.
Published: (2026)
A User-Centric Multi-Intent Benchmark for Evaluating Large Language Models
by: Wang, Jiayin, et al.
Published: (2024)
by: Wang, Jiayin, et al.
Published: (2024)
When Individually Calibrated Models Become Collectively Miscalibrated
by: Wang, Zhaohui
Published: (2026)
by: Wang, Zhaohui
Published: (2026)
WeatherArchive-Bench: Benchmarking Retrieval-Augmented Reasoning for Historical Weather Archives
by: Yu, Yongan, et al.
Published: (2025)
by: Yu, Yongan, et al.
Published: (2025)
When Safety Becomes a Vulnerability: Exploiting LLM Alignment Homogeneity for Transferable Blocking in RAG
by: Li, Junchen, et al.
Published: (2026)
by: Li, Junchen, et al.
Published: (2026)
Blind Spot Navigation in Large Language Model Reasoning with Thought Space Explorer
by: Zhang, Jinghan, et al.
Published: (2024)
by: Zhang, Jinghan, et al.
Published: (2024)
Aligning Query Representation with Rewritten Query and Relevance Judgments in Conversational Search
by: Mo, Fengran, et al.
Published: (2024)
by: Mo, Fengran, et al.
Published: (2024)
History-Aware Conversational Dense Retrieval
by: Mo, Fengran, et al.
Published: (2024)
by: Mo, Fengran, et al.
Published: (2024)
When Emotion Becomes Trigger: Emotion-style dynamic Backdoor Attack Parasitising Large Language Models
by: Liu, Ziyu, et al.
Published: (2026)
by: Liu, Ziyu, et al.
Published: (2026)
A Survey on Large Language Models with Multilingualism: Recent Advances and New Frontiers
by: Huang, Kaiyu, et al.
Published: (2024)
by: Huang, Kaiyu, et al.
Published: (2024)
Hazards in Daily Life? Enabling Robots to Proactively Detect and Resolve Anomalies
by: Song, Zirui, et al.
Published: (2024)
by: Song, Zirui, et al.
Published: (2024)
Multi-Aspect Knowledge Distillation for Language Model with Low-rank Factorization
by: Liu, Zihe, et al.
Published: (2026)
by: Liu, Zihe, et al.
Published: (2026)
When Protest Becomes Crime
by: Terwindt, Carolijn
Published: (2022)
by: Terwindt, Carolijn
Published: (2022)
Boosting Biomedical Concept Extraction by Rule-Based Data Augmentation
by: Shao, Qiwei, et al.
Published: (2024)
by: Shao, Qiwei, et al.
Published: (2024)
Benchmarking Multi-modal Semantic Segmentation under Sensor Failures: Missing and Noisy Modality Robustness
by: Liao, Chenfei, et al.
Published: (2025)
by: Liao, Chenfei, et al.
Published: (2025)
43‐2: Research on Reducing operating Temperature Solutions for Large‐Sized Display Driver & Power Chips
by: Haiqi Mo, et al.
Published: (2025)
by: Haiqi Mo, et al.
Published: (2025)
Students Becoming Life-Long Users: Vision Becoming Reality.
by: Garlow, Judith A.
Published: (1995)
by: Garlow, Judith A.
Published: (1995)
CRMWeaver: Building Powerful Business Agent via Agentic RL and Shared Memories
by: Lai, Yilong, et al.
Published: (2025)
by: Lai, Yilong, et al.
Published: (2025)
When Change Becomes the Constant and Time the Variable Becoming Resilient to Change.
by: Klee, Edward, et al.
Published: (1998)
by: Klee, Edward, et al.
Published: (1998)
When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm
by: Leng, Ye, et al.
Published: (2026)
by: Leng, Ye, et al.
Published: (2026)
Adaptive Personalized Conversational Information Retrieval
by: Mo, Fengran, et al.
Published: (2025)
by: Mo, Fengran, et al.
Published: (2025)
Similar Items
-
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
by: Lou, Xinyue, et al.
Published: (2025) -
MUCAR: Benchmarking Multilingual Cross-Modal Ambiguity Resolution for Multimodal Large Language Models
by: Wang, Xiaolong, et al.
Published: (2025) -
DoRA: Enhancing Parameter-Efficient Fine-Tuning with Dynamic Rank Distribution
by: Mao, Yulong, et al.
Published: (2024) -
Multilingual Collaborative Defense for Large Language Models
by: Li, Hongliang, et al.
Published: (2025) -
SoT: Structured-of-Thought Prompting Guides Multilingual Reasoning in Large Language Models
by: Qi, Rui, et al.
Published: (2025)