TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Qiucheng, Xu, Ruijie, Chen, Mingang, Lu, Xuequan, Dong, Jianfeng, Lu, Chaochao, Tan, Xin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SHTOcc: Effective 3D Occupancy Prediction with Sparse Head and Tail Voxels
por: Yu, Qiucheng, et al.
Publicado: (2025)
por: Yu, Qiucheng, et al.
Publicado: (2025)
CELLO: Causal Evaluation of Large Vision-Language Models
por: Chen, Meiqi, et al.
Publicado: (2024)
por: Chen, Meiqi, et al.
Publicado: (2024)
LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models
por: Yu, Shu, et al.
Publicado: (2025)
por: Yu, Shu, et al.
Publicado: (2025)
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
por: Weng, Fenghua, et al.
Publicado: (2025)
por: Weng, Fenghua, et al.
Publicado: (2025)
Using Vision Language Models for Safety Hazard Identification in Construction
por: Adil, Muhammad, et al.
Publicado: (2025)
por: Adil, Muhammad, et al.
Publicado: (2025)
Adversarial Attacks on Both Face Recognition and Face Anti-spoofing Models
por: Zhou, Fengfan, et al.
Publicado: (2024)
por: Zhou, Fengfan, et al.
Publicado: (2024)
Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies
por: Pang, Cong, et al.
Publicado: (2025)
por: Pang, Cong, et al.
Publicado: (2025)
Seek-and-Solve: Benchmarking MLLMs for Visual Clue-Driven Reasoning in Daily Scenarios
por: Li, Xiaomin, et al.
Publicado: (2026)
por: Li, Xiaomin, et al.
Publicado: (2026)
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
por: Liu, Xin, et al.
Publicado: (2023)
por: Liu, Xin, et al.
Publicado: (2023)
ADAM: An Embodied Causal Agent in Open-World Environments
por: Yu, Shu, et al.
Publicado: (2024)
por: Yu, Shu, et al.
Publicado: (2024)
Learning Adaptive Node Selection with External Attention for Human Interaction Recognition
por: Pang, Chen, et al.
Publicado: (2025)
por: Pang, Chen, et al.
Publicado: (2025)
SU-SAM: A Simple Unified Framework for Adapting Segment Anything Model in Underperformed Scenes
por: Song, Yiran, et al.
Publicado: (2024)
por: Song, Yiran, et al.
Publicado: (2024)
InspecSafe-V1: A Multimodal Benchmark for Safety Assessment in Industrial Inspection Scenarios
por: Liu, Zeyi, et al.
Publicado: (2026)
por: Liu, Zeyi, et al.
Publicado: (2026)
Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective
por: Chen, Meiqi, et al.
Publicado: (2024)
por: Chen, Meiqi, et al.
Publicado: (2024)
SEP: Self-Enhanced Prompt Tuning for Visual-Language Model
por: Yao, Hantao, et al.
Publicado: (2024)
por: Yao, Hantao, et al.
Publicado: (2024)
IDMR: Towards Instance-Driven Precise Visual Correspondence in Multimodal Retrieval
por: Liu, Bangwei, et al.
Publicado: (2025)
por: Liu, Bangwei, et al.
Publicado: (2025)
video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models
por: Sun, Guangzhi, et al.
Publicado: (2024)
por: Sun, Guangzhi, et al.
Publicado: (2024)
SceneAssistant: A Visual Feedback Agent for Open-Vocabulary 3D Scene Generation
por: Luo, Jun, et al.
Publicado: (2026)
por: Luo, Jun, et al.
Publicado: (2026)
Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives
por: Shen, Yuhao, et al.
Publicado: (2025)
por: Shen, Yuhao, et al.
Publicado: (2025)
Interpreting Low-level Vision Models with Causal Effect Maps
por: Hu, Jinfan, et al.
Publicado: (2024)
por: Hu, Jinfan, et al.
Publicado: (2024)
Human-Imperceptible Physical Adversarial Attack for NIR Face Recognition Models
por: Xie, Songyan, et al.
Publicado: (2025)
por: Xie, Songyan, et al.
Publicado: (2025)
Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding
por: Wang, Youze, et al.
Publicado: (2025)
por: Wang, Youze, et al.
Publicado: (2025)
MambaH-Fit: Rethinking Hyper-surface Fitting-based Point Cloud Normal Estimation via State Space Modelling
por: Wang, Weijia, et al.
Publicado: (2025)
por: Wang, Weijia, et al.
Publicado: (2025)
A Divide-and-Conquer Approach for Global Orientation of Non-Watertight Scene-Level Point Clouds Using 0-1 Integer Optimization
por: Li, Zhuodong, et al.
Publicado: (2025)
por: Li, Zhuodong, et al.
Publicado: (2025)
Trustworthy Hate Speech Detection Through Visual Augmentation
por: Yang, Ziyuan, et al.
Publicado: (2024)
por: Yang, Ziyuan, et al.
Publicado: (2024)
BA-SAM: Scalable Bias-Mode Attention Mask for Segment Anything Model
por: Song, Yiran, et al.
Publicado: (2024)
por: Song, Yiran, et al.
Publicado: (2024)
Second Place Solution of WSDM2023 Toloka Visual Question Answering Challenge
por: Wu, Xiangyu, et al.
Publicado: (2024)
por: Wu, Xiangyu, et al.
Publicado: (2024)
CauSight: Learning to Supersense for Visual Causal Discovery
por: Zhang, Yize, et al.
Publicado: (2025)
por: Zhang, Yize, et al.
Publicado: (2025)
Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure
por: Chakraborty, Trishna, et al.
Publicado: (2026)
por: Chakraborty, Trishna, et al.
Publicado: (2026)
TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions
por: He, Xingwei, et al.
Publicado: (2024)
por: He, Xingwei, et al.
Publicado: (2024)
Benchmarking Ultra-High-Definition Image Reflection Removal
por: Zhang, Zhenyuan, et al.
Publicado: (2023)
por: Zhang, Zhenyuan, et al.
Publicado: (2023)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
por: Qiu, Lu, et al.
Publicado: (2024)
por: Qiu, Lu, et al.
Publicado: (2024)
Scenario Understanding of Traffic Scenes Through Large Visual Language Models
por: Rivera, Esteban, et al.
Publicado: (2025)
por: Rivera, Esteban, et al.
Publicado: (2025)
MMRel: Benchmarking Relation Understanding in Multi-Modal Large Language Models
por: Nie, Jiahao, et al.
Publicado: (2024)
por: Nie, Jiahao, et al.
Publicado: (2024)
R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios
por: Zhu, Lu, et al.
Publicado: (2025)
por: Zhu, Lu, et al.
Publicado: (2025)
CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios
por: Ye, Qilang, et al.
Publicado: (2024)
por: Ye, Qilang, et al.
Publicado: (2024)
ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation
por: Peng, Bo, et al.
Publicado: (2023)
por: Peng, Bo, et al.
Publicado: (2023)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
por: Xu, Weiye, et al.
Publicado: (2025)
por: Xu, Weiye, et al.
Publicado: (2025)
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
por: Guo, Xianda, et al.
Publicado: (2024)
por: Guo, Xianda, et al.
Publicado: (2024)
Safety of Multimodal Large Language Models on Images and Texts
por: Liu, Xin, et al.
Publicado: (2024)
por: Liu, Xin, et al.
Publicado: (2024)
Ejemplares similares
-
SHTOcc: Effective 3D Occupancy Prediction with Sparse Head and Tail Voxels
por: Yu, Qiucheng, et al.
Publicado: (2025) -
CELLO: Causal Evaluation of Large Vision-Language Models
por: Chen, Meiqi, et al.
Publicado: (2024) -
LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models
por: Yu, Shu, et al.
Publicado: (2025) -
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
por: Weng, Fenghua, et al.
Publicado: (2025) -
Using Vision Language Models for Safety Hazard Identification in Construction
por: Adil, Muhammad, et al.
Publicado: (2025)