Vision Language Model for Interpretable and Fine-grained Detection of Safety Compliance in Diverse Workplaces
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Zhiling, Chen, Hanning, Imani, Mohsen, Chen, Ruimin, Imani, Farhad |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can Multimodal Large Language Models be Guided to Improve Industrial Anomaly Detection?
por: Chen, Zhiling, et al.
Publicado: (2025)
por: Chen, Zhiling, et al.
Publicado: (2025)
Tell Me What to Track: Infusing Robust Language Guidance for Enhanced Referring Multi-Object Tracking
por: Huang, Wenjun, et al.
Publicado: (2024)
por: Huang, Wenjun, et al.
Publicado: (2024)
TorchTraceAP: A New Benchmark Dataset for Detecting Performance Anti-Patterns in Computer Vision Models
por: Chen, Hanning, et al.
Publicado: (2025)
por: Chen, Hanning, et al.
Publicado: (2025)
Residualized Temporal Sparse Autoencoders for Interpreting Diffusion Models
por: Yeung, Calvin, et al.
Publicado: (2026)
por: Yeung, Calvin, et al.
Publicado: (2026)
Self-Attention Based Semantic Decomposition in Vector Symbolic Architectures
por: Yeung, Calvin, et al.
Publicado: (2024)
por: Yeung, Calvin, et al.
Publicado: (2024)
LVLM_CSP: Accelerating Large Vision Language Models via Clustering, Scattering, and Pruning for Reasoning Segmentation
por: Chen, Hanning, et al.
Publicado: (2025)
por: Chen, Hanning, et al.
Publicado: (2025)
Coupled Inference in Diffusion Models for Semantic Decomposition
por: Yeung, Calvin, et al.
Publicado: (2026)
por: Yeung, Calvin, et al.
Publicado: (2026)
Fair Context Learning for Evidence-Balanced Test-Time Adaptation in Vision-Language Models
por: Yun, Sanggeon, et al.
Publicado: (2026)
por: Yun, Sanggeon, et al.
Publicado: (2026)
Task-Aware Scanning Parameter Configuration for Robotic Inspection Using Vision Language Embeddings and Hyperdimensional Computing
por: Chen, Zhiling, et al.
Publicado: (2026)
por: Chen, Zhiling, et al.
Publicado: (2026)
TaskCLIP: Extend Large Vision-Language Model for Task Oriented Object Detection
por: Chen, Hanning, et al.
Publicado: (2024)
por: Chen, Hanning, et al.
Publicado: (2024)
Region-Aware Deformable Convolutions
por: Maleki, Abolfazl Saheban, et al.
Publicado: (2025)
por: Maleki, Abolfazl Saheban, et al.
Publicado: (2025)
A Neurosymbolic Framework for Interpretable Cognitive Attack Detection in Augmented Reality
por: Chen, Rongqian, et al.
Publicado: (2025)
por: Chen, Rongqian, et al.
Publicado: (2025)
Draft and Refine with Visual Experts
por: Jeong, Sungheon, et al.
Publicado: (2025)
por: Jeong, Sungheon, et al.
Publicado: (2025)
PV-VTT: A Privacy-Centric Dataset for Mission-Specific Anomaly Detection and Natural Language Interpretation
por: Masukawa, Ryozo, et al.
Publicado: (2024)
por: Masukawa, Ryozo, et al.
Publicado: (2024)
FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
por: Faure, Gueter Josmy, et al.
Publicado: (2026)
por: Faure, Gueter Josmy, et al.
Publicado: (2026)
Anatomy-VLM: A Fine-grained Vision-Language Model for Medical Interpretation
por: Gu, Difei, et al.
Publicado: (2025)
por: Gu, Difei, et al.
Publicado: (2025)
OmniMRI: A Unified Vision--Language Foundation Model for Generalist MRI Interpretation
por: He, Xingxin, et al.
Publicado: (2025)
por: He, Xingxin, et al.
Publicado: (2025)
Privacy-Preserving Federated Learning with Differentially Private Hyperdimensional Computing
por: Piran, Fardin Jalil, et al.
Publicado: (2024)
por: Piran, Fardin Jalil, et al.
Publicado: (2024)
Seeing the Unseen: Towards Zero-Shot Inspection for Wind Turbine Blades using Knowledge-Augmented Vision Language Models
por: Zhang, Yang, et al.
Publicado: (2025)
por: Zhang, Yang, et al.
Publicado: (2025)
Navigating the Nuances: A Fine-grained Evaluation of Vision-Language Navigation
por: Wang, Zehao, et al.
Publicado: (2024)
por: Wang, Zehao, et al.
Publicado: (2024)
MERIT: Multi-domain Efficient RAW Image Translation
por: Huang, Wenjun, et al.
Publicado: (2026)
por: Huang, Wenjun, et al.
Publicado: (2026)
VLTP: Vision-Language Guided Token Pruning for Task-Oriented Segmentation
por: Chen, Hanning, et al.
Publicado: (2024)
por: Chen, Hanning, et al.
Publicado: (2024)
A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models
por: Chen, Wutao, et al.
Publicado: (2026)
por: Chen, Wutao, et al.
Publicado: (2026)
On the Utility of Foundation Models for Fast MRI: Vision-Language-Guided Image Reconstruction
por: Feng, Ruimin, et al.
Publicado: (2025)
por: Feng, Ruimin, et al.
Publicado: (2025)
Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection
por: Jeong, Sungheon, et al.
Publicado: (2025)
por: Jeong, Sungheon, et al.
Publicado: (2025)
EcoSense: Energy-Efficient Intelligent Sensing for In-Shore Ship Detection through Edge-Cloud Collaboration
por: Huang, Wenjun, et al.
Publicado: (2024)
por: Huang, Wenjun, et al.
Publicado: (2024)
Panoptic Perception: A Novel Task and Fine-grained Dataset for Universal Remote Sensing Image Interpretation
por: Zhao, Danpei, et al.
Publicado: (2024)
por: Zhao, Danpei, et al.
Publicado: (2024)
Lost in Space: Probing Fine-grained Spatial Understanding in Vision and Language Resamplers
por: Pantazopoulos, Georgios, et al.
Publicado: (2024)
por: Pantazopoulos, Georgios, et al.
Publicado: (2024)
Expanding Event Modality Applications through a Robust CLIP-Based Encoder
por: Jeong, Sungheon, et al.
Publicado: (2024)
por: Jeong, Sungheon, et al.
Publicado: (2024)
INSIGHT: Enhancing Autonomous Driving Safety through Vision-Language Models on Context-Aware Hazard Detection and Edge Case Evaluation
por: Chen, Dianwei, et al.
Publicado: (2025)
por: Chen, Dianwei, et al.
Publicado: (2025)
Zooming into Comics: Region-Aware RL Improves Fine-Grained Comic Understanding in Vision-Language Models
por: Chen, Yule, et al.
Publicado: (2025)
por: Chen, Yule, et al.
Publicado: (2025)
Cyclic Vision-Language Manipulator: Towards Reliable and Fine-Grained Image Interpretation for Automated Report Generation
por: Fang, Yingying, et al.
Publicado: (2024)
por: Fang, Yingying, et al.
Publicado: (2024)
Enhancing Interpretability for Vision Models via Shapley Value Optimization
por: Fan, Kanglong, et al.
Publicado: (2025)
por: Fan, Kanglong, et al.
Publicado: (2025)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
por: Tan, Huajie, et al.
Publicado: (2025)
por: Tan, Huajie, et al.
Publicado: (2025)
RaVL: Discovering and Mitigating Spurious Correlations in Fine-Tuned Vision-Language Models
por: Varma, Maya, et al.
Publicado: (2024)
por: Varma, Maya, et al.
Publicado: (2024)
How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking
por: Li, Xuchen, et al.
Publicado: (2024)
por: Li, Xuchen, et al.
Publicado: (2024)
Safety Alignment for Vision Language Models
por: Liu, Zhendong, et al.
Publicado: (2024)
por: Liu, Zhendong, et al.
Publicado: (2024)
Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling
por: Chen, Qiyuan, et al.
Publicado: (2026)
por: Chen, Qiyuan, et al.
Publicado: (2026)
Fine-Tuning Vision-Language Model for Automated Engineering Drawing Information Extraction
por: Khan, Muhammad Tayyab, et al.
Publicado: (2024)
por: Khan, Muhammad Tayyab, et al.
Publicado: (2024)
VisuRiddles: Fine-grained Perception is a Primary Bottleneck for Multimodal Large Language Models in Abstract Visual Reasoning
por: Yan, Hao, et al.
Publicado: (2025)
por: Yan, Hao, et al.
Publicado: (2025)
Ejemplares similares
-
Can Multimodal Large Language Models be Guided to Improve Industrial Anomaly Detection?
por: Chen, Zhiling, et al.
Publicado: (2025) -
Tell Me What to Track: Infusing Robust Language Guidance for Enhanced Referring Multi-Object Tracking
por: Huang, Wenjun, et al.
Publicado: (2024) -
TorchTraceAP: A New Benchmark Dataset for Detecting Performance Anti-Patterns in Computer Vision Models
por: Chen, Hanning, et al.
Publicado: (2025) -
Residualized Temporal Sparse Autoencoders for Interpreting Diffusion Models
por: Yeung, Calvin, et al.
Publicado: (2026) -
Self-Attention Based Semantic Decomposition in Vector Symbolic Architectures
por: Yeung, Calvin, et al.
Publicado: (2024)