Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Zhou, Lijie |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
par: Yan, Hanqi, et autres
Publié: (2025)
par: Yan, Hanqi, et autres
Publié: (2025)
GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models
par: Shen, Guanxi
Publié: (2025)
par: Shen, Guanxi
Publié: (2025)
CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models
par: Xiu, Kedong, et autres
Publié: (2025)
par: Xiu, Kedong, et autres
Publié: (2025)
Cross-Modal Adapter for Vision-Language Retrieval
par: Jiang, Haojun, et autres
Publié: (2022)
par: Jiang, Haojun, et autres
Publié: (2022)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
par: Feng, Qianhan, et autres
Publié: (2024)
par: Feng, Qianhan, et autres
Publié: (2024)
Hierarchical Modeling for Medical Visual Question Answering with Cross-Attention Fusion
par: Zhang, Junkai, et autres
Publié: (2025)
par: Zhang, Junkai, et autres
Publié: (2025)
CASA: Cross-Attention over Self-Attention for Efficient Vision-Language Fusion
par: Böhle, Moritz, et autres
Publié: (2025)
par: Böhle, Moritz, et autres
Publié: (2025)
Jailbreaking Vision-Language Models Through the Visual Modality
par: Azulay, Aharon, et autres
Publié: (2026)
par: Azulay, Aharon, et autres
Publié: (2026)
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
par: Xu, Shicheng, et autres
Publié: (2024)
par: Xu, Shicheng, et autres
Publié: (2024)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
par: Zhang, Yudong, et autres
Publié: (2024)
par: Zhang, Yudong, et autres
Publié: (2024)
Where Reliability Lives in Vision-Language Models: A Mechanistic Study of Attention, Hidden States, and Causal Circuits
par: Mann, Logan, et autres
Publié: (2026)
par: Mann, Logan, et autres
Publié: (2026)
Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding
par: Kang, Seil, et autres
Publié: (2025)
par: Kang, Seil, et autres
Publié: (2025)
GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models
par: Liao, Haicheng, et autres
Publié: (2023)
par: Liao, Haicheng, et autres
Publié: (2023)
Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
par: Zhang, Chengsheng, et autres
Publié: (2026)
par: Zhang, Chengsheng, et autres
Publié: (2026)
Cross-Modal Attention Calibration for LVLM Hallucination Mitigation
par: Li, Jiaming, et autres
Publié: (2025)
par: Li, Jiaming, et autres
Publié: (2025)
Edge Reliability Gap in Vision-Language Models: Quantifying Failure Modes of Compressed VLMs Under Visual Corruption
par: Erol, Mehmet Kaan
Publié: (2026)
par: Erol, Mehmet Kaan
Publié: (2026)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability
par: Li, Chengzhi, et autres
Publié: (2025)
par: Li, Chengzhi, et autres
Publié: (2025)
Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI
par: Ernhofer, Benjamin Raphael, et autres
Publié: (2025)
par: Ernhofer, Benjamin Raphael, et autres
Publié: (2025)
Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
par: Xu, Juangui, et autres
Publié: (2025)
par: Xu, Juangui, et autres
Publié: (2025)
A-VL: Adaptive Attention for Large Vision-Language Models
par: Zhang, Junyang, et autres
Publié: (2024)
par: Zhang, Junyang, et autres
Publié: (2024)
GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation
par: Guo, Shasha, et autres
Publié: (2025)
par: Guo, Shasha, et autres
Publié: (2025)
MBQ: Modality-Balanced Quantization for Large Vision-Language Models
par: Li, Shiyao, et autres
Publié: (2024)
par: Li, Shiyao, et autres
Publié: (2024)
Freeze and Reveal: Exposing Modality Bias in Vision-Language Models
par: Kavuri, Vivek Hruday, et autres
Publié: (2025)
par: Kavuri, Vivek Hruday, et autres
Publié: (2025)
TPC: Cross-Temporal Prediction Connection for Vision-Language Model Hallucination Reduction
par: Wang, Chao, et autres
Publié: (2025)
par: Wang, Chao, et autres
Publié: (2025)
Large Vision-Language Models Get Lost in Attention
par: Xi, Gongli, et autres
Publié: (2026)
par: Xi, Gongli, et autres
Publié: (2026)
Attention Prompting on Image for Large Vision-Language Models
par: Yu, Runpeng, et autres
Publié: (2024)
par: Yu, Runpeng, et autres
Publié: (2024)
CMHANet: A Cross-Modal Hybrid Attention Network for Point Cloud Registration
par: Zhang, Dongxu, et autres
Publié: (2026)
par: Zhang, Dongxu, et autres
Publié: (2026)
BiomedAP: A Vision-Informed Dual-Anchor Framework with Gated Cross-Modal Fusion for Robust Medical Vision-Language Adaptation
par: Tong, Huanyang, et autres
Publié: (2026)
par: Tong, Huanyang, et autres
Publié: (2026)
Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
par: Zhao, Jianfei, et autres
Publié: (2025)
par: Zhao, Jianfei, et autres
Publié: (2025)
Modelling Visual Semantics via Image Captioning to extract Enhanced Multi-Level Cross-Modal Semantic Incongruity Representation with Attention for Multimodal Sarcasm Detection
par: Aggarwal, Sajal, et autres
Publié: (2024)
par: Aggarwal, Sajal, et autres
Publié: (2024)
A Unified Debiasing Approach for Vision-Language Models across Modalities and Tasks
par: Jung, Hoin, et autres
Publié: (2024)
par: Jung, Hoin, et autres
Publié: (2024)
VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation
par: Li, Bo, et autres
Publié: (2026)
par: Li, Bo, et autres
Publié: (2026)
3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection
par: Zhu, Haowen, et autres
Publié: (2026)
par: Zhu, Haowen, et autres
Publié: (2026)
Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment
par: Zheng, Yuze, et autres
Publié: (2024)
par: Zheng, Yuze, et autres
Publié: (2024)
VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
par: Qin, Guangshuo, et autres
Publié: (2026)
par: Qin, Guangshuo, et autres
Publié: (2026)
SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models
par: Tang, Zhenwei, et autres
Publié: (2025)
par: Tang, Zhenwei, et autres
Publié: (2025)
Attention Guided CAM: Visual Explanations of Vision Transformer Guided by Self-Attention
par: Leem, Saebom, et autres
Publié: (2024)
par: Leem, Saebom, et autres
Publié: (2024)
Leveraging Vision-Language Models to Detect Attention in Educational Videos
par: Becquet, Gabriel, et autres
Publié: (2026)
par: Becquet, Gabriel, et autres
Publié: (2026)
Preserving Cross-Modal Stability for Visual Unlearning in Multimodal Scenarios
par: Li, Jinghan Xu Yuyang Zhang Qixuan Cai Jiancheng Chen Keqiu
Publié: (2025)
par: Li, Jinghan Xu Yuyang Zhang Qixuan Cai Jiancheng Chen Keqiu
Publié: (2025)
Documents similaires
-
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
par: Yan, Hanqi, et autres
Publié: (2025) -
GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models
par: Shen, Guanxi
Publié: (2025) -
CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models
par: Xiu, Kedong, et autres
Publié: (2025) -
Cross-Modal Adapter for Vision-Language Retrieval
par: Jiang, Haojun, et autres
Publié: (2022) -
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
par: Feng, Qianhan, et autres
Publié: (2024)