Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Deniz, Omer Faruk, Mao, Ruiyu, Li, Ruochen, Tian, Yapeng, Khan, Latifur |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
par: Zhang, Ce, et autres
Publié: (2025)
par: Zhang, Ce, et autres
Publié: (2025)
Vision-centric Token Compression in Large Language Model
par: Xing, Ling, et autres
Publié: (2025)
par: Xing, Ling, et autres
Publié: (2025)
Efficient Self-Improvement in Multimodal Large Language Models: A Model-Level Judge-Free Approach
par: Deng, Shijian, et autres
Publié: (2024)
par: Deng, Shijian, et autres
Publié: (2024)
On the Limits of Token Reduction for Efficient Unified Vision Language Training
par: Chen, Siyi, et autres
Publié: (2026)
par: Chen, Siyi, et autres
Publié: (2026)
LEO-MINI: An Efficient Multimodal Large Language Model using Conditional Token Reduction and Mixture of Multi-Modal Experts
par: Wang, Yimu, et autres
Publié: (2025)
par: Wang, Yimu, et autres
Publié: (2025)
Token Sequence Compression for Efficient Multimodal Computing
par: Omri, Yasmine, et autres
Publié: (2025)
par: Omri, Yasmine, et autres
Publié: (2025)
LFTR: Learning-Free Token Reduction for Multimodal Large Language Models
par: Zhao, Zihui, et autres
Publié: (2025)
par: Zhao, Zihui, et autres
Publié: (2025)
PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model
par: Arif, Kazi Hasan Ibn, et autres
Publié: (2025)
par: Arif, Kazi Hasan Ibn, et autres
Publié: (2025)
Learning Compact Vision Tokens for Efficient Large Multimodal Models
par: Tang, Hao, et autres
Publié: (2025)
par: Tang, Hao, et autres
Publié: (2025)
InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models
par: Liu, Xinxin, et autres
Publié: (2026)
par: Liu, Xinxin, et autres
Publié: (2026)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
par: Shang, Yuzhang, et autres
Publié: (2024)
par: Shang, Yuzhang, et autres
Publié: (2024)
Efficient Whole Slide Pathology VQA via Token Compression
par: Lyu, Weimin, et autres
Publié: (2025)
par: Lyu, Weimin, et autres
Publié: (2025)
Self-Improvement in Multimodal Large Language Models: A Survey
par: Deng, Shijian, et autres
Publié: (2025)
par: Deng, Shijian, et autres
Publié: (2025)
From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models
par: Shang, Yuying, et autres
Publié: (2024)
par: Shang, Yuying, et autres
Publié: (2024)
Efficient Vision-Language Reasoning via Adaptive Token Pruning
par: Li, Xue, et autres
Publié: (2025)
par: Li, Xue, et autres
Publié: (2025)
SignLLM: Sign Language Production Large Language Models
par: Fang, Sen, et autres
Publié: (2024)
par: Fang, Sen, et autres
Publié: (2024)
ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers
par: Yuan, Qianhao, et autres
Publié: (2025)
par: Yuan, Qianhao, et autres
Publié: (2025)
Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
par: Zhao, Haozhe, et autres
Publié: (2024)
par: Zhao, Haozhe, et autres
Publié: (2024)
TriAttention: Efficient Long Reasoning with Trigonometric KV Compression
par: Mao, Weian, et autres
Publié: (2026)
par: Mao, Weian, et autres
Publié: (2026)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
par: Zhang, Shaolei, et autres
Publié: (2025)
par: Zhang, Shaolei, et autres
Publié: (2025)
ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention
par: Liu, Wenjie, et autres
Publié: (2026)
par: Liu, Wenjie, et autres
Publié: (2026)
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
par: Wang, Zihu, et autres
Publié: (2025)
par: Wang, Zihu, et autres
Publié: (2025)
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration
par: Fazli, Mehrdad, et autres
Publié: (2025)
par: Fazli, Mehrdad, et autres
Publié: (2025)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
par: Zhou, Qiji, et autres
Publié: (2024)
par: Zhou, Qiji, et autres
Publié: (2024)
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
par: Xing, Long, et autres
Publié: (2024)
par: Xing, Long, et autres
Publié: (2024)
Modality-Inconsistent Continual Learning of Multimodal Large Language Models
par: Pian, Weiguo, et autres
Publié: (2024)
par: Pian, Weiguo, et autres
Publié: (2024)
To Preserve or To Compress: An In-Depth Study of Connector Selection in Multimodal Large Language Models
par: Lin, Junyan, et autres
Publié: (2024)
par: Lin, Junyan, et autres
Publié: (2024)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
par: Li, Jingru, et autres
Publié: (2026)
par: Li, Jingru, et autres
Publié: (2026)
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
par: Yuan, Zhengqing, et autres
Publié: (2023)
par: Yuan, Zhengqing, et autres
Publié: (2023)
Preserving Knowledge in Large Language Model with Model-Agnostic Self-Decompression
par: Zhang, Zilun, et autres
Publié: (2024)
par: Zhang, Zilun, et autres
Publié: (2024)
LVLM-Compress-Bench: Benchmarking the Broader Impact of Large Vision-Language Model Compression
par: Kundu, Souvik, et autres
Publié: (2025)
par: Kundu, Souvik, et autres
Publié: (2025)
Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers
par: Wen, Yuxin, et autres
Publié: (2024)
par: Wen, Yuxin, et autres
Publié: (2024)
HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit
par: Wu, Hao, et autres
Publié: (2026)
par: Wu, Hao, et autres
Publié: (2026)
Adversarial Robustness of Discriminative Self-Supervised Learning in Vision
par: Çağatan, Ömer Veysel, et autres
Publié: (2025)
par: Çağatan, Ömer Veysel, et autres
Publié: (2025)
The First to Know: How Token Distributions Reveal Hidden Knowledge in Large Vision-Language Models?
par: Zhao, Qinyu, et autres
Publié: (2024)
par: Zhao, Qinyu, et autres
Publié: (2024)
Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models
par: Li, Bin, et autres
Publié: (2025)
par: Li, Bin, et autres
Publié: (2025)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
par: Zhang, Hongzhi, et autres
Publié: (2025)
par: Zhang, Hongzhi, et autres
Publié: (2025)
Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention
par: An, Wenbin, et autres
Publié: (2024)
par: An, Wenbin, et autres
Publié: (2024)
Documents similaires
-
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
par: Zhang, Ce, et autres
Publié: (2025) -
Vision-centric Token Compression in Large Language Model
par: Xing, Ling, et autres
Publié: (2025) -
Efficient Self-Improvement in Multimodal Large Language Models: A Model-Level Judge-Free Approach
par: Deng, Shijian, et autres
Publié: (2024) -
On the Limits of Token Reduction for Efficient Unified Vision Language Training
par: Chen, Siyi, et autres
Publié: (2026) -
LEO-MINI: An Efficient Multimodal Large Language Model using Conditional Token Reduction and Mixture of Multi-Modal Experts
par: Wang, Yimu, et autres
Publié: (2025)