A-VL: Adaptive Attention for Large Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Junyang, Yuan, Mu, Zhong, Ruiguang, Luo, Puhan, Zhan, Huiyou, Zhang, Ningkang, Hu, Chengchen, Li, Xiangyang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Qianfan-VL: Domain-Enhanced Universal Vision-Language Models
di: Dong, Daxiang, et al.
Pubblicazione: (2025)
di: Dong, Daxiang, et al.
Pubblicazione: (2025)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
di: He, Yefei, et al.
Pubblicazione: (2024)
di: He, Yefei, et al.
Pubblicazione: (2024)
InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models
di: Tao, Hongyuan, et al.
Pubblicazione: (2025)
di: Tao, Hongyuan, et al.
Pubblicazione: (2025)
VL-Uncertainty: Detecting Hallucination in Large Vision-Language Model via Uncertainty Estimation
di: Zhang, Ruiyang, et al.
Pubblicazione: (2024)
di: Zhang, Ruiyang, et al.
Pubblicazione: (2024)
Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
di: Wen, Zichen, et al.
Pubblicazione: (2026)
di: Wen, Zichen, et al.
Pubblicazione: (2026)
ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language Tuning
di: Hao, Zhiwei, et al.
Pubblicazione: (2024)
di: Hao, Zhiwei, et al.
Pubblicazione: (2024)
Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
di: Yao, Yuan, et al.
Pubblicazione: (2026)
di: Yao, Yuan, et al.
Pubblicazione: (2026)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
di: Zhang, Jianke, et al.
Pubblicazione: (2026)
di: Zhang, Jianke, et al.
Pubblicazione: (2026)
OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics
di: Shen, Jinjie, et al.
Pubblicazione: (2026)
di: Shen, Jinjie, et al.
Pubblicazione: (2026)
VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
di: Xiao, Wenyi, et al.
Pubblicazione: (2026)
di: Xiao, Wenyi, et al.
Pubblicazione: (2026)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
di: Li, Jianjian, et al.
Pubblicazione: (2025)
di: Li, Jianjian, et al.
Pubblicazione: (2025)
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
di: Wang, Peng, et al.
Pubblicazione: (2024)
di: Wang, Peng, et al.
Pubblicazione: (2024)
SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding
di: Cheng, Shuang, et al.
Pubblicazione: (2025)
di: Cheng, Shuang, et al.
Pubblicazione: (2025)
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
di: Chen, Jiuhai, et al.
Pubblicazione: (2024)
di: Chen, Jiuhai, et al.
Pubblicazione: (2024)
ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models
di: Yi, Jingwei, et al.
Pubblicazione: (2025)
di: Yi, Jingwei, et al.
Pubblicazione: (2025)
Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Models
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
Flash-VL 2B: Optimizing Vision-Language Model Performance for Ultra-Low Latency and High Throughput
di: Zhang, Bo, et al.
Pubblicazione: (2025)
di: Zhang, Bo, et al.
Pubblicazione: (2025)
RaVL: Discovering and Mitigating Spurious Correlations in Fine-Tuned Vision-Language Models
di: Varma, Maya, et al.
Pubblicazione: (2024)
di: Varma, Maya, et al.
Pubblicazione: (2024)
Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN Countries
di: Pranav, Tushar, et al.
Pubblicazione: (2025)
di: Pranav, Tushar, et al.
Pubblicazione: (2025)
TAP-VL: Text Layout-Aware Pre-training for Enriched Vision-Language Models
di: Fhima, Jonathan, et al.
Pubblicazione: (2024)
di: Fhima, Jonathan, et al.
Pubblicazione: (2024)
GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models
di: Pei, Ruiguang, et al.
Pubblicazione: (2025)
di: Pei, Ruiguang, et al.
Pubblicazione: (2025)
MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning
di: Liu, Yi, et al.
Pubblicazione: (2025)
di: Liu, Yi, et al.
Pubblicazione: (2025)
OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL
di: Shen, Jinjie, et al.
Pubblicazione: (2026)
di: Shen, Jinjie, et al.
Pubblicazione: (2026)
EventVL: Understand Event Streams via Multimodal Large Language Model
di: Li, Pengteng, et al.
Pubblicazione: (2025)
di: Li, Pengteng, et al.
Pubblicazione: (2025)
Efficient and Comprehensive Feature Extraction in Large Vision-Language Model for Pathology Analysis
di: Zhang, Shengxuming, et al.
Pubblicazione: (2024)
di: Zhang, Shengxuming, et al.
Pubblicazione: (2024)
AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model
di: Jin, Zhiwei, et al.
Pubblicazione: (2025)
di: Jin, Zhiwei, et al.
Pubblicazione: (2025)
Large Vision-Language Models Get Lost in Attention
di: Xi, Gongli, et al.
Pubblicazione: (2026)
di: Xi, Gongli, et al.
Pubblicazione: (2026)
Attention Prompting on Image for Large Vision-Language Models
di: Yu, Runpeng, et al.
Pubblicazione: (2024)
di: Yu, Runpeng, et al.
Pubblicazione: (2024)
Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models
di: Zhong, Yi, et al.
Pubblicazione: (2026)
di: Zhong, Yi, et al.
Pubblicazione: (2026)
SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model
di: Zhang, Yongting, et al.
Pubblicazione: (2024)
di: Zhang, Yongting, et al.
Pubblicazione: (2024)
FiVL: A Framework for Improved Vision-Language Alignment through the Lens of Training, Evaluation and Explainability
di: Aflalo, Estelle, et al.
Pubblicazione: (2024)
di: Aflalo, Estelle, et al.
Pubblicazione: (2024)
VL-DPO: Vision-Language-Guided Finetuning for Preference-Aligned Autonomous Driving
di: Xu, Zhefan, et al.
Pubblicazione: (2026)
di: Xu, Zhefan, et al.
Pubblicazione: (2026)
AttAnchor: Guiding Cross-Modal Token Alignment in VLMs with Attention Anchors
di: Zhang, Junyang, et al.
Pubblicazione: (2025)
di: Zhang, Junyang, et al.
Pubblicazione: (2025)
CrossVL: Complexity-Aware Feature Routing and Paired Curriculum for Cross-View Vision-Language Detection
di: Liu, Zhipeng, et al.
Pubblicazione: (2026)
di: Liu, Zhipeng, et al.
Pubblicazione: (2026)
GenderBias-\emph{VL}: Benchmarking Gender Bias in Vision Language Models via Counterfactual Probing
di: Xiao, Yisong, et al.
Pubblicazione: (2024)
di: Xiao, Yisong, et al.
Pubblicazione: (2024)
DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
di: Wu, Zhiyu, et al.
Pubblicazione: (2024)
di: Wu, Zhiyu, et al.
Pubblicazione: (2024)
MAP: Mitigating Hallucinations in Large Vision-Language Models with Map-Level Attention Processing
di: Li, Chenxi, et al.
Pubblicazione: (2025)
di: Li, Chenxi, et al.
Pubblicazione: (2025)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
Conscious Gaze: Adaptive Attention Mechanisms for Hallucination Mitigation in Vision-Language Models
di: Bu, Weijue, et al.
Pubblicazione: (2025)
di: Bu, Weijue, et al.
Pubblicazione: (2025)
LL-ICM: Image Compression for Low-level Machine Vision via Large Vision-Language Model
di: Xue, Yuan, et al.
Pubblicazione: (2024)
di: Xue, Yuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Qianfan-VL: Domain-Enhanced Universal Vision-Language Models
di: Dong, Daxiang, et al.
Pubblicazione: (2025) -
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
di: He, Yefei, et al.
Pubblicazione: (2024) -
InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models
di: Tao, Hongyuan, et al.
Pubblicazione: (2025) -
VL-Uncertainty: Detecting Hallucination in Large Vision-Language Model via Uncertainty Estimation
di: Zhang, Ruiyang, et al.
Pubblicazione: (2024) -
Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
di: Wen, Zichen, et al.
Pubblicazione: (2026)