RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Hongliang, Zhang, Jiaxin, Liao, Wenhui, Peng, Dezhi, Ding, Kai, Jin, Lianwen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Faster Parameter-Efficient Tuning with Token Redundancy Reduction
von: Kim, Kwonyoung, et al.
Veröffentlicht: (2025)
von: Kim, Kwonyoung, et al.
Veröffentlicht: (2025)
DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
von: Liao, Wenhui, et al.
Veröffentlicht: (2024)
von: Liao, Wenhui, et al.
Veröffentlicht: (2024)
DocRes: A Generalist Model Toward Unifying Document Image Restoration Tasks
von: Zhang, Jiaxin, et al.
Veröffentlicht: (2024)
von: Zhang, Jiaxin, et al.
Veröffentlicht: (2024)
ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning
von: Lee, Yuna, et al.
Veröffentlicht: (2026)
von: Lee, Yuna, et al.
Veröffentlicht: (2026)
UPOCR: Towards Unified Pixel-Level OCR Interface
von: Peng, Dezhi, et al.
Veröffentlicht: (2023)
von: Peng, Dezhi, et al.
Veröffentlicht: (2023)
ViTEraser: Harnessing the Power of Vision Transformers for Scene Text Removal with SegMIM Pretraining
von: Peng, Dezhi, et al.
Veröffentlicht: (2023)
von: Peng, Dezhi, et al.
Veröffentlicht: (2023)
TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos
von: Yao, Linli, et al.
Veröffentlicht: (2025)
von: Yao, Linli, et al.
Veröffentlicht: (2025)
DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
von: Zhang, Jiaxin, et al.
Veröffentlicht: (2024)
von: Zhang, Jiaxin, et al.
Veröffentlicht: (2024)
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
von: Bagrov, Natan, et al.
Veröffentlicht: (2025)
von: Bagrov, Natan, et al.
Veröffentlicht: (2025)
DecoderTracker: Decoder-Only Method for Multiple-Object Tracking
von: Pan, Liao, et al.
Veröffentlicht: (2023)
von: Pan, Liao, et al.
Veröffentlicht: (2023)
Efficient Redundancy Reduction for Open-Vocabulary Semantic Segmentation
von: Chen, Lin, et al.
Veröffentlicht: (2025)
von: Chen, Lin, et al.
Veröffentlicht: (2025)
EVEREST: Efficient Masked Video Autoencoder by Removing Redundant Spatiotemporal Tokens
von: Hwang, Sunil, et al.
Veröffentlicht: (2022)
von: Hwang, Sunil, et al.
Veröffentlicht: (2022)
A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models
von: Li, Duo, et al.
Veröffentlicht: (2025)
von: Li, Duo, et al.
Veröffentlicht: (2025)
Cached Adaptive Token Merging: Dynamic Token Reduction and Redundant Computation Elimination in Diffusion Model
von: Saghatchian, Omid, et al.
Veröffentlicht: (2025)
von: Saghatchian, Omid, et al.
Veröffentlicht: (2025)
LEGO: Self-Supervised Representation Learning for Scene Text Images
von: Ren, Yujin, et al.
Veröffentlicht: (2024)
von: Ren, Yujin, et al.
Veröffentlicht: (2024)
SwinTextSpotter v2: Towards Better Synergy for Scene Text Spotting
von: Huang, Mingxin, et al.
Veröffentlicht: (2024)
von: Huang, Mingxin, et al.
Veröffentlicht: (2024)
Exploiting Mixture-of-Experts Redundancy Unlocks Multimodal Generative Abilities
von: Dutt, Raman, et al.
Veröffentlicht: (2025)
von: Dutt, Raman, et al.
Veröffentlicht: (2025)
Seeing Beyond Redundancy: Task Complexity's Role in Vision Token Specialization in VLLMs
von: Hannan, Darryl, et al.
Veröffentlicht: (2026)
von: Hannan, Darryl, et al.
Veröffentlicht: (2026)
Beyond Intermediate States: Explaining Visual Redundancy through Language
von: Yang, Dingchen, et al.
Veröffentlicht: (2025)
von: Yang, Dingchen, et al.
Veröffentlicht: (2025)
R^2MoE: Redundancy-Removal Mixture of Experts for Lifelong Concept Learning
von: Guo, Xiaohan, et al.
Veröffentlicht: (2025)
von: Guo, Xiaohan, et al.
Veröffentlicht: (2025)
Capturing More: Learning Multi-Domain Representations for Robust Online Handwriting Verification
von: Zhang, Peirong, et al.
Veröffentlicht: (2025)
von: Zhang, Peirong, et al.
Veröffentlicht: (2025)
What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models
von: Fan, Yingqi, et al.
Veröffentlicht: (2026)
von: Fan, Yingqi, et al.
Veröffentlicht: (2026)
EEdit: Rethinking the Spatial and Temporal Redundancy for Efficient Image Editing
von: Yan, Zexuan, et al.
Veröffentlicht: (2025)
von: Yan, Zexuan, et al.
Veröffentlicht: (2025)
Predicting the Original Appearance of Damaged Historical Documents
von: Yang, Zhenhua, et al.
Veröffentlicht: (2024)
von: Yang, Zhenhua, et al.
Veröffentlicht: (2024)
Exploiting Information Redundancy in Attention Maps for Extreme Quantization of Vision Transformers
von: Maisonnave, Lucas, et al.
Veröffentlicht: (2025)
von: Maisonnave, Lucas, et al.
Veröffentlicht: (2025)
Expedited Training of Visual Conditioned Language Generation via Redundancy Reduction
von: Jian, Yiren, et al.
Veröffentlicht: (2023)
von: Jian, Yiren, et al.
Veröffentlicht: (2023)
Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding
von: Kim, Jiwan, et al.
Veröffentlicht: (2026)
von: Kim, Jiwan, et al.
Veröffentlicht: (2026)
Learning to Rank Patches for Unbiased Image Redundancy Reduction
von: Luo, Yang, et al.
Veröffentlicht: (2024)
von: Luo, Yang, et al.
Veröffentlicht: (2024)
Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs
von: Su, Yongyi, et al.
Veröffentlicht: (2025)
von: Su, Yongyi, et al.
Veröffentlicht: (2025)
LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs
von: Krojer, Benno, et al.
Veröffentlicht: (2026)
von: Krojer, Benno, et al.
Veröffentlicht: (2026)
Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image Pyramid
von: Huang, Mingxin, et al.
Veröffentlicht: (2024)
von: Huang, Mingxin, et al.
Veröffentlicht: (2024)
Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
von: Fang, Zhengyao, et al.
Veröffentlicht: (2026)
von: Fang, Zhengyao, et al.
Veröffentlicht: (2026)
EchoPrune: Interpreting Redundancy as Temporal Echoes for Efficient VideoLLMs
von: Li, Jiameng, et al.
Veröffentlicht: (2026)
von: Li, Jiameng, et al.
Veröffentlicht: (2026)
Towards Redundancy Reduction in Diffusion Models for Efficient Video Super-Resolution
von: Guo, Jinpei, et al.
Veröffentlicht: (2025)
von: Guo, Jinpei, et al.
Veröffentlicht: (2025)
QG-VTC: Question-Guided Visual Token Compression in MLLMs for Efficient VQA
von: Li, Shuai, et al.
Veröffentlicht: (2025)
von: Li, Shuai, et al.
Veröffentlicht: (2025)
[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs
von: Wang, Ao, et al.
Veröffentlicht: (2024)
von: Wang, Ao, et al.
Veröffentlicht: (2024)
Sliding-Window Merging for Compacting Patch-Redundant Layers in LLMs
von: Ding, Xuan, et al.
Veröffentlicht: (2025)
von: Ding, Xuan, et al.
Veröffentlicht: (2025)
Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy
von: Yang, Te, et al.
Veröffentlicht: (2024)
von: Yang, Te, et al.
Veröffentlicht: (2024)
Color-Oriented Redundancy Reduction in Dataset Distillation
von: Yuan, Bowen, et al.
Veröffentlicht: (2024)
von: Yuan, Bowen, et al.
Veröffentlicht: (2024)
Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs
von: Li, Qi, et al.
Veröffentlicht: (2026)
von: Li, Qi, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Faster Parameter-Efficient Tuning with Token Redundancy Reduction
von: Kim, Kwonyoung, et al.
Veröffentlicht: (2025) -
DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
von: Liao, Wenhui, et al.
Veröffentlicht: (2024) -
DocRes: A Generalist Model Toward Unifying Document Image Restoration Tasks
von: Zhang, Jiaxin, et al.
Veröffentlicht: (2024) -
ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning
von: Lee, Yuna, et al.
Veröffentlicht: (2026) -
UPOCR: Towards Unified Pixel-Level OCR Interface
von: Peng, Dezhi, et al.
Veröffentlicht: (2023)