Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Qiong, Lin, Wenhao, Zhou, Yiyi, Ye, Weihao, Zen, Zhanpeng, Sun, Xiaoshuai, Ji, Rongrong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Not All Attention is Needed: Parameter and Computation Efficient Transfer Learning for Multi-modal Large Language Models
par: Wu, Qiong, et autres
Publié: (2024)
par: Wu, Qiong, et autres
Publié: (2024)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
par: Ye, Weihao, et autres
Publié: (2024)
par: Ye, Weihao, et autres
Publié: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
par: Wu, Qiong, et autres
Publié: (2025)
par: Wu, Qiong, et autres
Publié: (2025)
Routing Experts: Learning to Route Dynamic Experts in Multi-modal Large Language Models
par: Wu, Qiong, et autres
Publié: (2024)
par: Wu, Qiong, et autres
Publié: (2024)
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
par: Zhan, Wengyi, et autres
Publié: (2025)
par: Zhan, Wengyi, et autres
Publié: (2025)
MMAPS: End-to-End Multi-Grained Multi-Modal Attribute-Aware Product Summarization
par: Chen, Tao, et autres
Publié: (2023)
par: Chen, Tao, et autres
Publié: (2023)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
par: Yang, Danni, et autres
Publié: (2024)
par: Yang, Danni, et autres
Publié: (2024)
SAM as the Guide: Mastering Pseudo-Label Refinement in Semi-Supervised Referring Expression Segmentation
par: Yang, Danni, et autres
Publié: (2024)
par: Yang, Danni, et autres
Publié: (2024)
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
par: Hu, Anwen, et autres
Publié: (2023)
par: Hu, Anwen, et autres
Publié: (2023)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
par: Jiang, Chaoya, et autres
Publié: (2024)
par: Jiang, Chaoya, et autres
Publié: (2024)
Multimodal Large Language Models for Medicine: A Comprehensive Survey
par: Ye, Jiarui, et autres
Publié: (2025)
par: Ye, Jiarui, et autres
Publié: (2025)
Towards Universal Modal Tracking with Online Dense Temporal Token Learning
par: Zheng, Yaozong, et autres
Publié: (2025)
par: Zheng, Yaozong, et autres
Publié: (2025)
Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation
par: Zhang, Bo, et autres
Publié: (2024)
par: Zhang, Bo, et autres
Publié: (2024)
OralGPT-Omni: A Versatile Dental Multimodal Large Language Model
par: Hao, Jing, et autres
Publié: (2025)
par: Hao, Jing, et autres
Publié: (2025)
Multimodal Infusion Tuning for Large Models
par: Sun, Hao, et autres
Publié: (2024)
par: Sun, Hao, et autres
Publié: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
par: Chen, Tao, et autres
Publié: (2026)
par: Chen, Tao, et autres
Publié: (2026)
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
par: He, Xin, et autres
Publié: (2024)
par: He, Xin, et autres
Publié: (2024)
Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues
par: Fu, Junchen, et autres
Publié: (2026)
par: Fu, Junchen, et autres
Publié: (2026)
Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
par: Li, Zhu, et autres
Publié: (2025)
par: Li, Zhu, et autres
Publié: (2025)
Towards Training-free Multimodal Hate Localisation with Large Language Models
par: Sun, Yueming, et autres
Publié: (2026)
par: Sun, Yueming, et autres
Publié: (2026)
GalleryGPT: Analyzing Paintings with Large Multimodal Models
par: Bin, Yi, et autres
Publié: (2024)
par: Bin, Yi, et autres
Publié: (2024)
Can Multimodal Large Language Models Understand Spatial Relations?
par: Liu, Jingping, et autres
Publié: (2025)
par: Liu, Jingping, et autres
Publié: (2025)
Learning Compact Vision Tokens for Efficient Large Multimodal Models
par: Tang, Hao, et autres
Publié: (2025)
par: Tang, Hao, et autres
Publié: (2025)
Listening to the Unspoken: Exploring "365" Aspects of Multimodal Interview Performance Assessment
par: Li, Jia, et autres
Publié: (2025)
par: Li, Jia, et autres
Publié: (2025)
Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark
par: Zhang, Hanlei, et autres
Publié: (2025)
par: Zhang, Hanlei, et autres
Publié: (2025)
Traj-MLLM: Can Multimodal Large Language Models Reform Trajectory Data Mining?
par: Liu, Shuo, et autres
Publié: (2025)
par: Liu, Shuo, et autres
Publié: (2025)
Remember Past, Anticipate Future: Learning Continual Multimodal Misinformation Detectors
par: Wang, Bing, et autres
Publié: (2025)
par: Wang, Bing, et autres
Publié: (2025)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
par: Cocchi, Federico, et autres
Publié: (2024)
par: Cocchi, Federico, et autres
Publié: (2024)
RETRO: REthinking Tactile Representation Learning with Material PriOrs
par: Xia, Weihao, et autres
Publié: (2025)
par: Xia, Weihao, et autres
Publié: (2025)
A Bounding Box is Worth One Token: Interleaving Layout and Text in a Large Language Model for Document Understanding
par: Lu, Jinghui, et autres
Publié: (2024)
par: Lu, Jinghui, et autres
Publié: (2024)
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
par: Luo, Gen, et autres
Publié: (2024)
par: Luo, Gen, et autres
Publié: (2024)
Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
par: Caffagni, Davide, et autres
Publié: (2025)
par: Caffagni, Davide, et autres
Publié: (2025)
A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification
par: Calbucura, Nicolas, et autres
Publié: (2025)
par: Calbucura, Nicolas, et autres
Publié: (2025)
Knowledge-Guided Dynamic Modality Attention Fusion Framework for Multimodal Sentiment Analysis
par: Feng, Xinyu, et autres
Publié: (2024)
par: Feng, Xinyu, et autres
Publié: (2024)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
par: Xu, Yifang, et autres
Publié: (2025)
par: Xu, Yifang, et autres
Publié: (2025)
Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation
par: Yu, Lijun, et autres
Publié: (2023)
par: Yu, Lijun, et autres
Publié: (2023)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
par: An, Wenbin, et autres
Publié: (2024)
par: An, Wenbin, et autres
Publié: (2024)
What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph
par: Jiang, Yutao, et autres
Publié: (2025)
par: Jiang, Yutao, et autres
Publié: (2025)
Multimodal Misinformation Detection using Large Vision-Language Models
par: Tahmasebi, Sahar, et autres
Publié: (2024)
par: Tahmasebi, Sahar, et autres
Publié: (2024)
FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression
par: Tong, Bo, et autres
Publié: (2024)
par: Tong, Bo, et autres
Publié: (2024)
Documents similaires
-
Not All Attention is Needed: Parameter and Computation Efficient Transfer Learning for Multi-modal Large Language Models
par: Wu, Qiong, et autres
Publié: (2024) -
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
par: Ye, Weihao, et autres
Publié: (2024) -
Grounded Chain-of-Thought for Multimodal Large Language Models
par: Wu, Qiong, et autres
Publié: (2025) -
Routing Experts: Learning to Route Dynamic Experts in Multi-modal Large Language Models
par: Wu, Qiong, et autres
Publié: (2024) -
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
par: Zhan, Wengyi, et autres
Publié: (2025)