Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Imran, Muhammad, Lee, Yugyung |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Predicting When to Trust Vision-Language Models for Spatial Reasoning
di: Imran, Muhammad, et al.
Pubblicazione: (2026)
di: Imran, Muhammad, et al.
Pubblicazione: (2026)
MATEX: Multi-scale Attention and Text-guided Explainability of Medical Vision-Language Models
di: Imran, Muhammad, et al.
Pubblicazione: (2026)
di: Imran, Muhammad, et al.
Pubblicazione: (2026)
Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face Detector
di: Guo, Xiao, et al.
Pubblicazione: (2025)
di: Guo, Xiao, et al.
Pubblicazione: (2025)
MSGL-Transformer: A Multi-Scale Global-Local Transformer for Rodent Social Behavior Recognition
di: Sharif, Muhammad Imran, et al.
Pubblicazione: (2026)
di: Sharif, Muhammad Imran, et al.
Pubblicazione: (2026)
Brain-Gen: Towards Interpreting Neural Signals for Stimulus Reconstruction Using Transformers and Latent Diffusion Models
di: Aslam, Hasib, et al.
Pubblicazione: (2025)
di: Aslam, Hasib, et al.
Pubblicazione: (2025)
Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model
di: Chen, Shiming, et al.
Pubblicazione: (2025)
di: Chen, Shiming, et al.
Pubblicazione: (2025)
SEMIR: Semantic Minor-Induced Representation Learning on Graphs for Visual Segmentation
di: Miller, Luke James, et al.
Pubblicazione: (2026)
di: Miller, Luke James, et al.
Pubblicazione: (2026)
Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization
di: Li, Jiaqi, et al.
Pubblicazione: (2026)
di: Li, Jiaqi, et al.
Pubblicazione: (2026)
Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models
di: Cheng, Silin, et al.
Pubblicazione: (2025)
di: Cheng, Silin, et al.
Pubblicazione: (2025)
MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models
di: Chen, Kaixiang, et al.
Pubblicazione: (2026)
di: Chen, Kaixiang, et al.
Pubblicazione: (2026)
LVLM-Interpret: An Interpretability Tool for Large Vision-Language Models
di: Stan, Gabriela Ben Melech, et al.
Pubblicazione: (2024)
di: Stan, Gabriela Ben Melech, et al.
Pubblicazione: (2024)
Localization Meets Uncertainty: Uncertainty-Aware Multi-Modal Localization
di: Won, Hye-Min, et al.
Pubblicazione: (2025)
di: Won, Hye-Min, et al.
Pubblicazione: (2025)
DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2024)
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2024)
MMRL: Multi-Modal Representation Learning for Vision-Language Models
di: Guo, Yuncheng, et al.
Pubblicazione: (2025)
di: Guo, Yuncheng, et al.
Pubblicazione: (2025)
Prompting Medical Vision-Language Models to Mitigate Diagnosis Bias by Generating Realistic Dermoscopic Images
di: Munia, Nusrat, et al.
Pubblicazione: (2025)
di: Munia, Nusrat, et al.
Pubblicazione: (2025)
MultiMedVision: Multi-Modal Medical Vision Framework
di: Li, Frank, et al.
Pubblicazione: (2026)
di: Li, Frank, et al.
Pubblicazione: (2026)
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
di: Lei, Xuanyu, et al.
Pubblicazione: (2024)
di: Lei, Xuanyu, et al.
Pubblicazione: (2024)
LoMo: Local Modality Substitution for Deeper Vision-Language Fusion
di: Han, Feng, et al.
Pubblicazione: (2026)
di: Han, Feng, et al.
Pubblicazione: (2026)
Vision-Enhanced Large Language Models for High-Resolution Image Synthesis and Multimodal Data Interpretation
di: KV, Karthikeya
Pubblicazione: (2025)
di: KV, Karthikeya
Pubblicazione: (2025)
Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2025)
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2025)
Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models
di: Lv, Weiyi, et al.
Pubblicazione: (2025)
di: Lv, Weiyi, et al.
Pubblicazione: (2025)
Using Vision Language Models for Safety Hazard Identification in Construction
di: Adil, Muhammad, et al.
Pubblicazione: (2025)
di: Adil, Muhammad, et al.
Pubblicazione: (2025)
Multi-Modal Adapter for Vision-Language Models
di: Seputis, Dominykas, et al.
Pubblicazione: (2024)
di: Seputis, Dominykas, et al.
Pubblicazione: (2024)
Perceive and Calibrate: Analyzing and Enhancing Robustness of Medical Multi-Modal Large Language Models
di: XU, Dunyuan, et al.
Pubblicazione: (2025)
di: XU, Dunyuan, et al.
Pubblicazione: (2025)
Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models
di: Jung, Daniel Sungho, et al.
Pubblicazione: (2026)
di: Jung, Daniel Sungho, et al.
Pubblicazione: (2026)
Cross-Modal Attention Guided Unlearning in Vision-Language Models
di: Bhaila, Karuna, et al.
Pubblicazione: (2025)
di: Bhaila, Karuna, et al.
Pubblicazione: (2025)
A Vision-Language Foundation Model to Enhance Efficiency of Chest X-ray Interpretation
di: Chen, Zhihong, et al.
Pubblicazione: (2024)
di: Chen, Zhihong, et al.
Pubblicazione: (2024)
SkyMoE: A Vision-Language Foundation Model for Enhancing Geospatial Interpretation with Mixture of Experts
di: Liu, Jiaqi, et al.
Pubblicazione: (2025)
di: Liu, Jiaqi, et al.
Pubblicazione: (2025)
BioGait-VLM: A Tri-Modal Vision-Language-Biomechanics Framework for Interpretable Clinical Gait Assessment
di: Chen, Erdong, et al.
Pubblicazione: (2026)
di: Chen, Erdong, et al.
Pubblicazione: (2026)
VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models
di: Wang, Chenyu, et al.
Pubblicazione: (2026)
di: Wang, Chenyu, et al.
Pubblicazione: (2026)
Mechanisms of Object Localization in Vision-Language Models
di: Schaumlöffel, Timothy, et al.
Pubblicazione: (2026)
di: Schaumlöffel, Timothy, et al.
Pubblicazione: (2026)
Locality Alignment Improves Vision-Language Models
di: Covert, Ian, et al.
Pubblicazione: (2024)
di: Covert, Ian, et al.
Pubblicazione: (2024)
RingMoE: Mixture-of-Modality-Experts Multi-Modal Foundation Models for Universal Remote Sensing Image Interpretation
di: Bi, Hanbo, et al.
Pubblicazione: (2025)
di: Bi, Hanbo, et al.
Pubblicazione: (2025)
SpatiaLoc: Leveraging Multi-Level Spatial Enhanced Descriptors for Cross-Modal Localization
di: Shang, Tianyi, et al.
Pubblicazione: (2026)
di: Shang, Tianyi, et al.
Pubblicazione: (2026)
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
di: Deria, Ankan, et al.
Pubblicazione: (2026)
di: Deria, Ankan, et al.
Pubblicazione: (2026)
Enhancing Continual Learning of Vision-Language Models via Dynamic Prefix Weighting
di: Jang, Hyeonseo, et al.
Pubblicazione: (2026)
di: Jang, Hyeonseo, et al.
Pubblicazione: (2026)
Semantic-Preserving Cross-Style Visual Reasoning for Robust Multi-Modal Understanding in Large Vision-Language Models
di: Nakayama, Aya, et al.
Pubblicazione: (2025)
di: Nakayama, Aya, et al.
Pubblicazione: (2025)
Beyond Memorization: A Multi-Modal Ordinal Regression Benchmark to Expose Popularity Bias in Vision-Language Models
di: Szu-Tu, Li-Zhong, et al.
Pubblicazione: (2025)
di: Szu-Tu, Li-Zhong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Predicting When to Trust Vision-Language Models for Spatial Reasoning
di: Imran, Muhammad, et al.
Pubblicazione: (2026) -
MATEX: Multi-scale Attention and Text-guided Explainability of Medical Vision-Language Models
di: Imran, Muhammad, et al.
Pubblicazione: (2026) -
Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face Detector
di: Guo, Xiao, et al.
Pubblicazione: (2025) -
MSGL-Transformer: A Multi-Scale Global-Local Transformer for Rodent Social Behavior Recognition
di: Sharif, Muhammad Imran, et al.
Pubblicazione: (2026) -
Brain-Gen: Towards Interpreting Neural Signals for Stimulus Reconstruction Using Transformers and Latent Diffusion Models
di: Aslam, Hasib, et al.
Pubblicazione: (2025)