GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| 1. Verfasser: | Shen, Guanxi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
von: Xu, Shicheng, et al.
Veröffentlicht: (2024)
von: Xu, Shicheng, et al.
Veröffentlicht: (2024)
VHELM: A Holistic Evaluation of Vision Language Models
von: Lee, Tony, et al.
Veröffentlicht: (2024)
von: Lee, Tony, et al.
Veröffentlicht: (2024)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
von: Yan, Hanqi, et al.
Veröffentlicht: (2025)
von: Yan, Hanqi, et al.
Veröffentlicht: (2025)
Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
von: Zhang, Chengsheng, et al.
Veröffentlicht: (2026)
von: Zhang, Chengsheng, et al.
Veröffentlicht: (2026)
HoliSafe: Holistic Safety Benchmarking and Modeling for Vision-Language Model
von: Lee, Youngwan, et al.
Veröffentlicht: (2025)
von: Lee, Youngwan, et al.
Veröffentlicht: (2025)
MBQ: Modality-Balanced Quantization for Large Vision-Language Models
von: Li, Shiyao, et al.
Veröffentlicht: (2024)
von: Li, Shiyao, et al.
Veröffentlicht: (2024)
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
von: Yasunaga, Michihiro, et al.
Veröffentlicht: (2025)
von: Yasunaga, Michihiro, et al.
Veröffentlicht: (2025)
GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation
von: Guo, Shasha, et al.
Veröffentlicht: (2025)
von: Guo, Shasha, et al.
Veröffentlicht: (2025)
Cross-Modal Adapter for Vision-Language Retrieval
von: Jiang, Haojun, et al.
Veröffentlicht: (2022)
von: Jiang, Haojun, et al.
Veröffentlicht: (2022)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
von: Feng, Qianhan, et al.
Veröffentlicht: (2024)
von: Feng, Qianhan, et al.
Veröffentlicht: (2024)
GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models
von: Liao, Haicheng, et al.
Veröffentlicht: (2023)
von: Liao, Haicheng, et al.
Veröffentlicht: (2023)
Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models
von: Zhong, Yi, et al.
Veröffentlicht: (2026)
von: Zhong, Yi, et al.
Veröffentlicht: (2026)
CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models
von: Xiu, Kedong, et al.
Veröffentlicht: (2025)
von: Xiu, Kedong, et al.
Veröffentlicht: (2025)
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
von: Zhou, Lijie
Veröffentlicht: (2026)
von: Zhou, Lijie
Veröffentlicht: (2026)
GROUNDHOG: Grounding Large Language Models to Holistic Segmentation
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
Sparks of Explainability: Recent Advancements in Explaining Large Vision Models
von: Fel, Thomas
Veröffentlicht: (2025)
von: Fel, Thomas
Veröffentlicht: (2025)
FM-G-CAM: A Holistic Approach for Explainable AI in Computer Vision
von: Silva, Ravidu Suien Rammuni, et al.
Veröffentlicht: (2023)
von: Silva, Ravidu Suien Rammuni, et al.
Veröffentlicht: (2023)
Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM
von: Li, Shen, et al.
Veröffentlicht: (2025)
von: Li, Shen, et al.
Veröffentlicht: (2025)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
von: Yan, Bei, et al.
Veröffentlicht: (2024)
von: Yan, Bei, et al.
Veröffentlicht: (2024)
Cross-Cultural Value Awareness in Large Vision-Language Models
von: Howard, Phillip, et al.
Veröffentlicht: (2026)
von: Howard, Phillip, et al.
Veröffentlicht: (2026)
Freeze and Reveal: Exposing Modality Bias in Vision-Language Models
von: Kavuri, Vivek Hruday, et al.
Veröffentlicht: (2025)
von: Kavuri, Vivek Hruday, et al.
Veröffentlicht: (2025)
MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models
von: Zhang, Fan, et al.
Veröffentlicht: (2025)
von: Zhang, Fan, et al.
Veröffentlicht: (2025)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
von: Zhang, Yudong, et al.
Veröffentlicht: (2024)
von: Zhang, Yudong, et al.
Veröffentlicht: (2024)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
von: Yuan, Botai, et al.
Veröffentlicht: (2025)
von: Yuan, Botai, et al.
Veröffentlicht: (2025)
DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
von: Bousselham, Walid, et al.
Veröffentlicht: (2026)
von: Bousselham, Walid, et al.
Veröffentlicht: (2026)
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
von: Li, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Li, Zhiyuan, et al.
Veröffentlicht: (2024)
SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models
von: Tang, Zhenwei, et al.
Veröffentlicht: (2025)
von: Tang, Zhenwei, et al.
Veröffentlicht: (2025)
VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
von: Qin, Guangshuo, et al.
Veröffentlicht: (2026)
von: Qin, Guangshuo, et al.
Veröffentlicht: (2026)
HIPPO: Accelerating Video Large Language Models Inference via Holistic-aware Parallel Speculative Decoding
von: Lv, Qitan, et al.
Veröffentlicht: (2026)
von: Lv, Qitan, et al.
Veröffentlicht: (2026)
MammothModa: Multi-Modal Large Language Model
von: She, Qi, et al.
Veröffentlicht: (2024)
von: She, Qi, et al.
Veröffentlicht: (2024)
BiomedAP: A Vision-Informed Dual-Anchor Framework with Gated Cross-Modal Fusion for Robust Medical Vision-Language Adaptation
von: Tong, Huanyang, et al.
Veröffentlicht: (2026)
von: Tong, Huanyang, et al.
Veröffentlicht: (2026)
CBVLM: Training-free Explainable Concept-based Large Vision Language Models for Medical Image Classification
von: Patrício, Cristiano, et al.
Veröffentlicht: (2025)
von: Patrício, Cristiano, et al.
Veröffentlicht: (2025)
FOCA: Frequency-Oriented Cross-Domain Forgery Detection, Localization and Explanation via Multi-Modal Large Language Model
von: Liu, Zhou, et al.
Veröffentlicht: (2026)
von: Liu, Zhou, et al.
Veröffentlicht: (2026)
Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
von: Zhao, Jianfei, et al.
Veröffentlicht: (2025)
von: Zhao, Jianfei, et al.
Veröffentlicht: (2025)
Visual Anagrams Reveal Hidden Differences in Holistic Shape Processing Across Vision Models
von: Doshi, Fenil R., et al.
Veröffentlicht: (2025)
von: Doshi, Fenil R., et al.
Veröffentlicht: (2025)
Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models
von: Peng, Wei, et al.
Veröffentlicht: (2025)
von: Peng, Wei, et al.
Veröffentlicht: (2025)
A Unified Debiasing Approach for Vision-Language Models across Modalities and Tasks
von: Jung, Hoin, et al.
Veröffentlicht: (2024)
von: Jung, Hoin, et al.
Veröffentlicht: (2024)
XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models
von: Wang, Xingrui, et al.
Veröffentlicht: (2025)
von: Wang, Xingrui, et al.
Veröffentlicht: (2025)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
von: Wang, Yizhou, et al.
Veröffentlicht: (2025)
von: Wang, Yizhou, et al.
Veröffentlicht: (2025)
Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation
von: Kim, Ju-Young, et al.
Veröffentlicht: (2025)
von: Kim, Ju-Young, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
von: Xu, Shicheng, et al.
Veröffentlicht: (2024) -
VHELM: A Holistic Evaluation of Vision Language Models
von: Lee, Tony, et al.
Veröffentlicht: (2024) -
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
von: Yan, Hanqi, et al.
Veröffentlicht: (2025) -
Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
von: Zhang, Chengsheng, et al.
Veröffentlicht: (2026) -
HoliSafe: Holistic Safety Benchmarking and Modeling for Vision-Language Model
von: Lee, Youngwan, et al.
Veröffentlicht: (2025)