Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
Fuente:
arXiv
Salvato in:
| Autori principali: | Wen, Zichen, Gao, Yifeng, Li, Weijia, He, Conghui, Zhang, Linfeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More
di: Wen, Zichen, et al.
Pubblicazione: (2025)
di: Wen, Zichen, et al.
Pubblicazione: (2025)
Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
di: Wen, Zichen, et al.
Pubblicazione: (2025)
di: Wen, Zichen, et al.
Pubblicazione: (2025)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
di: Xiong, Minhao, et al.
Pubblicazione: (2025)
di: Xiong, Minhao, et al.
Pubblicazione: (2025)
HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models
di: Guo, Yansong, et al.
Pubblicazione: (2026)
di: Guo, Yansong, et al.
Pubblicazione: (2026)
Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation
di: Wen, Siwei, et al.
Pubblicazione: (2025)
di: Wen, Siwei, et al.
Pubblicazione: (2025)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
di: Ye, Weihao, et al.
Pubblicazione: (2024)
di: Ye, Weihao, et al.
Pubblicazione: (2024)
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
di: Wang, Yahong, et al.
Pubblicazione: (2026)
di: Wang, Yahong, et al.
Pubblicazione: (2026)
GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-training
di: Xia, Renqiu, et al.
Pubblicazione: (2024)
di: Xia, Renqiu, et al.
Pubblicazione: (2024)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
di: Zhu, Wenxin, et al.
Pubblicazione: (2025)
di: Zhu, Wenxin, et al.
Pubblicazione: (2025)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
di: Gao, Junyuan, et al.
Pubblicazione: (2025)
di: Gao, Junyuan, et al.
Pubblicazione: (2025)
D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning
di: Zhang, Evelyn, et al.
Pubblicazione: (2025)
di: Zhang, Evelyn, et al.
Pubblicazione: (2025)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
di: Tang, Zicong, et al.
Pubblicazione: (2025)
di: Tang, Zicong, et al.
Pubblicazione: (2025)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
Investigating Structural Pruning and Recovery Techniques for Compressing Multimodal Large Language Models: An Empirical Study
di: Huang, Yiran, et al.
Pubblicazione: (2025)
di: Huang, Yiran, et al.
Pubblicazione: (2025)
Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
di: Bai, Tianyi, et al.
Pubblicazione: (2025)
di: Bai, Tianyi, et al.
Pubblicazione: (2025)
LFTR: Learning-Free Token Reduction for Multimodal Large Language Models
di: Zhao, Zihui, et al.
Pubblicazione: (2025)
di: Zhao, Zihui, et al.
Pubblicazione: (2025)
ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
di: Xu, Shilin, et al.
Pubblicazione: (2025)
di: Xu, Shilin, et al.
Pubblicazione: (2025)
Shifting AI Efficiency From Model-Centric to Data-Centric Compression
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models
di: Chen, Junzhe, et al.
Pubblicazione: (2024)
di: Chen, Junzhe, et al.
Pubblicazione: (2024)
The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning
di: Jiang, Titong, et al.
Pubblicazione: (2025)
di: Jiang, Titong, et al.
Pubblicazione: (2025)
TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models
di: Lee, Jaewoo, et al.
Pubblicazione: (2025)
di: Lee, Jaewoo, et al.
Pubblicazione: (2025)
Efficient Vision-Language Reasoning via Adaptive Token Pruning
di: Li, Xue, et al.
Pubblicazione: (2025)
di: Li, Xue, et al.
Pubblicazione: (2025)
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
di: Bai, Tianyi, et al.
Pubblicazione: (2025)
di: Bai, Tianyi, et al.
Pubblicazione: (2025)
LEGION: Learning to Ground and Explain for Synthetic Image Detection
di: Kang, Hengrui, et al.
Pubblicazione: (2025)
di: Kang, Hengrui, et al.
Pubblicazione: (2025)
MMRQA: Signal-Enhanced Multimodal Large Language Models for MRI Quality Assessment
di: Jia, Fankai, et al.
Pubblicazione: (2025)
di: Jia, Fankai, et al.
Pubblicazione: (2025)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
di: Zhang, Ce, et al.
Pubblicazione: (2025)
di: Zhang, Ce, et al.
Pubblicazione: (2025)
UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking
di: Wu, Hao, et al.
Pubblicazione: (2026)
di: Wu, Hao, et al.
Pubblicazione: (2026)
Vision-centric Token Compression in Large Language Model
di: Xing, Ling, et al.
Pubblicazione: (2025)
di: Xing, Ling, et al.
Pubblicazione: (2025)
OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learning
di: Kang, Hengrui, et al.
Pubblicazione: (2025)
di: Kang, Hengrui, et al.
Pubblicazione: (2025)
GenieBlue: Integrating both Linguistic and Multimodal Capabilities for Large Language Models on Mobile Devices
di: Lu, Xudong, et al.
Pubblicazione: (2025)
di: Lu, Xudong, et al.
Pubblicazione: (2025)
UniChange: Unifying Change Detection with Multimodal Large Language Model
di: Zhang, Xu, et al.
Pubblicazione: (2025)
di: Zhang, Xu, et al.
Pubblicazione: (2025)
LEO-MINI: An Efficient Multimodal Large Language Model using Conditional Token Reduction and Mixture of Multi-Modal Experts
di: Wang, Yimu, et al.
Pubblicazione: (2025)
di: Wang, Yimu, et al.
Pubblicazione: (2025)
Can We Edit Multimodal Large Language Models?
di: Cheng, Siyuan, et al.
Pubblicazione: (2023)
di: Cheng, Siyuan, et al.
Pubblicazione: (2023)
IPCV: Information-Preserving Compression for MLLM Visual Encoders
di: Chen, Yuan, et al.
Pubblicazione: (2025)
di: Chen, Yuan, et al.
Pubblicazione: (2025)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
di: Li, Yifan, et al.
Pubblicazione: (2024)
di: Li, Yifan, et al.
Pubblicazione: (2024)
A Survey of Multimodal Large Language Model from A Data-centric Perspective
di: Bai, Tianyi, et al.
Pubblicazione: (2024)
di: Bai, Tianyi, et al.
Pubblicazione: (2024)
Multimodal Latent Language Modeling with Next-Token Diffusion
di: Sun, Yutao, et al.
Pubblicazione: (2024)
di: Sun, Yutao, et al.
Pubblicazione: (2024)
LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?
di: Cheng, Xueqi, et al.
Pubblicazione: (2026)
di: Cheng, Xueqi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More
di: Wen, Zichen, et al.
Pubblicazione: (2025) -
Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
di: Wen, Zichen, et al.
Pubblicazione: (2025) -
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
di: Xiong, Minhao, et al.
Pubblicazione: (2025) -
HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models
di: Guo, Yansong, et al.
Pubblicazione: (2026) -
Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
di: Liao, Chenfei, et al.
Pubblicazione: (2025)