Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Qiong, Lin, Wenhao, Zhou, Yiyi, Ye, Weihao, Zen, Zhanpeng, Sun, Xiaoshuai, Ji, Rongrong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Not All Attention is Needed: Parameter and Computation Efficient Transfer Learning for Multi-modal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2024)
di: Wu, Qiong, et al.
Pubblicazione: (2024)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
di: Ye, Weihao, et al.
Pubblicazione: (2024)
di: Ye, Weihao, et al.
Pubblicazione: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2025)
di: Wu, Qiong, et al.
Pubblicazione: (2025)
Routing Experts: Learning to Route Dynamic Experts in Multi-modal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2024)
di: Wu, Qiong, et al.
Pubblicazione: (2024)
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
di: Zhan, Wengyi, et al.
Pubblicazione: (2025)
di: Zhan, Wengyi, et al.
Pubblicazione: (2025)
MMAPS: End-to-End Multi-Grained Multi-Modal Attribute-Aware Product Summarization
di: Chen, Tao, et al.
Pubblicazione: (2023)
di: Chen, Tao, et al.
Pubblicazione: (2023)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
di: Yang, Danni, et al.
Pubblicazione: (2024)
di: Yang, Danni, et al.
Pubblicazione: (2024)
SAM as the Guide: Mastering Pseudo-Label Refinement in Semi-Supervised Referring Expression Segmentation
di: Yang, Danni, et al.
Pubblicazione: (2024)
di: Yang, Danni, et al.
Pubblicazione: (2024)
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
di: Hu, Anwen, et al.
Pubblicazione: (2023)
di: Hu, Anwen, et al.
Pubblicazione: (2023)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
Multimodal Large Language Models for Medicine: A Comprehensive Survey
di: Ye, Jiarui, et al.
Pubblicazione: (2025)
di: Ye, Jiarui, et al.
Pubblicazione: (2025)
Towards Universal Modal Tracking with Online Dense Temporal Token Learning
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation
di: Zhang, Bo, et al.
Pubblicazione: (2024)
di: Zhang, Bo, et al.
Pubblicazione: (2024)
OralGPT-Omni: A Versatile Dental Multimodal Large Language Model
di: Hao, Jing, et al.
Pubblicazione: (2025)
di: Hao, Jing, et al.
Pubblicazione: (2025)
Multimodal Infusion Tuning for Large Models
di: Sun, Hao, et al.
Pubblicazione: (2024)
di: Sun, Hao, et al.
Pubblicazione: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
di: Chen, Tao, et al.
Pubblicazione: (2026)
di: Chen, Tao, et al.
Pubblicazione: (2026)
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
di: He, Xin, et al.
Pubblicazione: (2024)
di: He, Xin, et al.
Pubblicazione: (2024)
Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues
di: Fu, Junchen, et al.
Pubblicazione: (2026)
di: Fu, Junchen, et al.
Pubblicazione: (2026)
Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
di: Li, Zhu, et al.
Pubblicazione: (2025)
di: Li, Zhu, et al.
Pubblicazione: (2025)
Towards Training-free Multimodal Hate Localisation with Large Language Models
di: Sun, Yueming, et al.
Pubblicazione: (2026)
di: Sun, Yueming, et al.
Pubblicazione: (2026)
GalleryGPT: Analyzing Paintings with Large Multimodal Models
di: Bin, Yi, et al.
Pubblicazione: (2024)
di: Bin, Yi, et al.
Pubblicazione: (2024)
Can Multimodal Large Language Models Understand Spatial Relations?
di: Liu, Jingping, et al.
Pubblicazione: (2025)
di: Liu, Jingping, et al.
Pubblicazione: (2025)
Learning Compact Vision Tokens for Efficient Large Multimodal Models
di: Tang, Hao, et al.
Pubblicazione: (2025)
di: Tang, Hao, et al.
Pubblicazione: (2025)
Listening to the Unspoken: Exploring "365" Aspects of Multimodal Interview Performance Assessment
di: Li, Jia, et al.
Pubblicazione: (2025)
di: Li, Jia, et al.
Pubblicazione: (2025)
Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark
di: Zhang, Hanlei, et al.
Pubblicazione: (2025)
di: Zhang, Hanlei, et al.
Pubblicazione: (2025)
Traj-MLLM: Can Multimodal Large Language Models Reform Trajectory Data Mining?
di: Liu, Shuo, et al.
Pubblicazione: (2025)
di: Liu, Shuo, et al.
Pubblicazione: (2025)
Remember Past, Anticipate Future: Learning Continual Multimodal Misinformation Detectors
di: Wang, Bing, et al.
Pubblicazione: (2025)
di: Wang, Bing, et al.
Pubblicazione: (2025)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
di: Cocchi, Federico, et al.
Pubblicazione: (2024)
di: Cocchi, Federico, et al.
Pubblicazione: (2024)
RETRO: REthinking Tactile Representation Learning with Material PriOrs
di: Xia, Weihao, et al.
Pubblicazione: (2025)
di: Xia, Weihao, et al.
Pubblicazione: (2025)
A Bounding Box is Worth One Token: Interleaving Layout and Text in a Large Language Model for Document Understanding
di: Lu, Jinghui, et al.
Pubblicazione: (2024)
di: Lu, Jinghui, et al.
Pubblicazione: (2024)
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
di: Luo, Gen, et al.
Pubblicazione: (2024)
di: Luo, Gen, et al.
Pubblicazione: (2024)
Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification
di: Calbucura, Nicolas, et al.
Pubblicazione: (2025)
di: Calbucura, Nicolas, et al.
Pubblicazione: (2025)
Knowledge-Guided Dynamic Modality Attention Fusion Framework for Multimodal Sentiment Analysis
di: Feng, Xinyu, et al.
Pubblicazione: (2024)
di: Feng, Xinyu, et al.
Pubblicazione: (2024)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
di: Xu, Yifang, et al.
Pubblicazione: (2025)
di: Xu, Yifang, et al.
Pubblicazione: (2025)
Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation
di: Yu, Lijun, et al.
Pubblicazione: (2023)
di: Yu, Lijun, et al.
Pubblicazione: (2023)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
di: An, Wenbin, et al.
Pubblicazione: (2024)
di: An, Wenbin, et al.
Pubblicazione: (2024)
What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph
di: Jiang, Yutao, et al.
Pubblicazione: (2025)
di: Jiang, Yutao, et al.
Pubblicazione: (2025)
Multimodal Misinformation Detection using Large Vision-Language Models
di: Tahmasebi, Sahar, et al.
Pubblicazione: (2024)
di: Tahmasebi, Sahar, et al.
Pubblicazione: (2024)
FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression
di: Tong, Bo, et al.
Pubblicazione: (2024)
di: Tong, Bo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Not All Attention is Needed: Parameter and Computation Efficient Transfer Learning for Multi-modal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2024) -
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
di: Ye, Weihao, et al.
Pubblicazione: (2024) -
Grounded Chain-of-Thought for Multimodal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2025) -
Routing Experts: Learning to Route Dynamic Experts in Multi-modal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2024) -
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
di: Zhan, Wengyi, et al.
Pubblicazione: (2025)