Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Yangfu, Zhan, Hongjian, Chen, Tianyi, Liu, Qi, Lu, Yue |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models
por: Li, Yangfu, et al.
Publicado: (2026)
por: Li, Yangfu, et al.
Publicado: (2026)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
por: Ye, Weihao, et al.
Publicado: (2024)
por: Ye, Weihao, et al.
Publicado: (2024)
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
por: Bai, Tianyi, et al.
Publicado: (2025)
por: Bai, Tianyi, et al.
Publicado: (2025)
UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking
por: Wu, Hao, et al.
Publicado: (2026)
por: Wu, Hao, et al.
Publicado: (2026)
PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding
por: Wang, Nan, et al.
Publicado: (2026)
por: Wang, Nan, et al.
Publicado: (2026)
The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning
por: Jiang, Titong, et al.
Publicado: (2025)
por: Jiang, Titong, et al.
Publicado: (2025)
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
por: Chung, Jiwan, et al.
Publicado: (2025)
por: Chung, Jiwan, et al.
Publicado: (2025)
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
por: Zhong, Yiwu, et al.
Publicado: (2024)
por: Zhong, Yiwu, et al.
Publicado: (2024)
Efficient Whole Slide Pathology VQA via Token Compression
por: Lyu, Weimin, et al.
Publicado: (2025)
por: Lyu, Weimin, et al.
Publicado: (2025)
Efficient Vision-Language Reasoning via Adaptive Token Pruning
por: Li, Xue, et al.
Publicado: (2025)
por: Li, Xue, et al.
Publicado: (2025)
Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning
por: Huang, Yihong, et al.
Publicado: (2026)
por: Huang, Yihong, et al.
Publicado: (2026)
Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
por: Zhang, Qizhe, et al.
Publicado: (2024)
por: Zhang, Qizhe, et al.
Publicado: (2024)
HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models
por: Guo, Yansong, et al.
Publicado: (2026)
por: Guo, Yansong, et al.
Publicado: (2026)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
por: Wen, Zichen, et al.
Publicado: (2025)
por: Wen, Zichen, et al.
Publicado: (2025)
ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance
por: Li, Duo, et al.
Publicado: (2025)
por: Li, Duo, et al.
Publicado: (2025)
HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit
por: Wu, Hao, et al.
Publicado: (2026)
por: Wu, Hao, et al.
Publicado: (2026)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
por: Zhang, Hongzhi, et al.
Publicado: (2025)
por: Zhang, Hongzhi, et al.
Publicado: (2025)
FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing
por: Tang, Zihan, et al.
Publicado: (2026)
por: Tang, Zihan, et al.
Publicado: (2026)
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
por: Tian, Changyuan, et al.
Publicado: (2026)
por: Tian, Changyuan, et al.
Publicado: (2026)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
por: Tang, Zicong, et al.
Publicado: (2025)
por: Tang, Zicong, et al.
Publicado: (2025)
Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling
por: Zou, Hongjian, et al.
Publicado: (2026)
por: Zou, Hongjian, et al.
Publicado: (2026)
See the Text: From Tokenization to Visual Reading
por: Xing, Ling, et al.
Publicado: (2025)
por: Xing, Ling, et al.
Publicado: (2025)
Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding
por: Kim, Jiwan, et al.
Publicado: (2026)
por: Kim, Jiwan, et al.
Publicado: (2026)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
por: Ji, Yicheng, et al.
Publicado: (2025)
por: Ji, Yicheng, et al.
Publicado: (2025)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
por: Song, Wei, et al.
Publicado: (2025)
por: Song, Wei, et al.
Publicado: (2025)
Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework
por: Yan, Yibo, et al.
Publicado: (2026)
por: Yan, Yibo, et al.
Publicado: (2026)
Efficient Document Parsing via Parallel Token Prediction
por: Li, Lei, et al.
Publicado: (2026)
por: Li, Lei, et al.
Publicado: (2026)
ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers
por: Yuan, Qianhao, et al.
Publicado: (2025)
por: Yuan, Qianhao, et al.
Publicado: (2025)
BabyVision: Visual Reasoning Beyond Language
por: Chen, Liang, et al.
Publicado: (2026)
por: Chen, Liang, et al.
Publicado: (2026)
Breaking through Deterministic Barriers: Randomized Pruning Mask Generation and Selection
por: Li, Jianwei, et al.
Publicado: (2023)
por: Li, Jianwei, et al.
Publicado: (2023)
ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning
por: Lee, Yuna, et al.
Publicado: (2026)
por: Lee, Yuna, et al.
Publicado: (2026)
Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval
por: Sun, Hao, et al.
Publicado: (2026)
por: Sun, Hao, et al.
Publicado: (2026)
Agri-R1: Agricultural Reasoning for Disease Diagnosis via Automated-Synthesis and Reinforcement Learning
por: Zhang, Wentao, et al.
Publicado: (2026)
por: Zhang, Wentao, et al.
Publicado: (2026)
Structural Anchor Pruning: Training-Free Multi-Vector Compression for Visual Document Retrieval
por: Liu, Zhuchenyang, et al.
Publicado: (2026)
por: Liu, Zhuchenyang, et al.
Publicado: (2026)
Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
por: Li, Kaiyuan, et al.
Publicado: (2025)
por: Li, Kaiyuan, et al.
Publicado: (2025)
Multi-Modal Multi-Granularity Tokenizer for Chu Bamboo Slip Scripts
por: Chen, Yingfa, et al.
Publicado: (2024)
por: Chen, Yingfa, et al.
Publicado: (2024)
OTPrune: Distribution-Aligned Visual Token Pruning via Optimal Transport
por: Chen, Xiwen, et al.
Publicado: (2026)
por: Chen, Xiwen, et al.
Publicado: (2026)
ResTok: Learning Hierarchical Residuals in 1D Visual Tokenizers for Autoregressive Image Generation
por: Zhang, Xu, et al.
Publicado: (2026)
por: Zhang, Xu, et al.
Publicado: (2026)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
por: Zhang, Ce, et al.
Publicado: (2025)
por: Zhang, Ce, et al.
Publicado: (2025)
Why Instruction-Based Unlearning Fails in Diffusion Models?
por: Zhang, Zeliang, et al.
Publicado: (2026)
por: Zhang, Zeliang, et al.
Publicado: (2026)
Ejemplares similares
-
DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models
por: Li, Yangfu, et al.
Publicado: (2026) -
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
por: Ye, Weihao, et al.
Publicado: (2024) -
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
por: Bai, Tianyi, et al.
Publicado: (2025) -
UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking
por: Wu, Hao, et al.
Publicado: (2026) -
PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding
por: Wang, Nan, et al.
Publicado: (2026)