Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration
Fuente:
arXiv
Salvato in:
| Autori principali: | Han, Yuhang, Liu, Xuyang, Zhang, Zihan, Ding, Pengxiang, Chen, Junjie, Wang, Donglin, Chen, Honggang, Yan, Qingsen, Huang, Siteng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
di: Chen, Junjie, et al.
Pubblicazione: (2025)
di: Chen, Junjie, et al.
Pubblicazione: (2025)
VGDiffZero: Text-to-image Diffusion Models Can Be Zero-shot Visual Grounders
di: Liu, Xuyang, et al.
Pubblicazione: (2023)
di: Liu, Xuyang, et al.
Pubblicazione: (2023)
VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration
di: Yu, Hanxun, et al.
Pubblicazione: (2026)
di: Yu, Hanxun, et al.
Pubblicazione: (2026)
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
di: Zhao, Han, et al.
Pubblicazione: (2024)
di: Zhao, Han, et al.
Pubblicazione: (2024)
DARA: Domain- and Relation-aware Adapters Make Parameter-efficient Tuning for Visual Grounding
di: Liu, Ting, et al.
Pubblicazione: (2024)
di: Liu, Ting, et al.
Pubblicazione: (2024)
Accelerating Diffusion Transformers with Token-wise Feature Caching
di: Zou, Chang, et al.
Pubblicazione: (2024)
di: Zou, Chang, et al.
Pubblicazione: (2024)
ProFD: Prompt-Guided Feature Disentangling for Occluded Person Re-Identification
di: Cui, Can, et al.
Pubblicazione: (2024)
di: Cui, Can, et al.
Pubblicazione: (2024)
M2IST: Multi-Modal Interactive Side-Tuning for Efficient Referring Expression Comprehension
di: Liu, Xuyang, et al.
Pubblicazione: (2024)
di: Liu, Xuyang, et al.
Pubblicazione: (2024)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
di: Liu, Yang, et al.
Pubblicazione: (2025)
di: Liu, Yang, et al.
Pubblicazione: (2025)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
di: Ding, Pengxiang, et al.
Pubblicazione: (2023)
di: Ding, Pengxiang, et al.
Pubblicazione: (2023)
CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction
di: Gong, Zhefei, et al.
Pubblicazione: (2024)
di: Gong, Zhefei, et al.
Pubblicazione: (2024)
Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration
di: Zeng, Fanhu, et al.
Pubblicazione: (2025)
di: Zeng, Fanhu, et al.
Pubblicazione: (2025)
QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning
di: Tong, Xinyang, et al.
Pubblicazione: (2024)
di: Tong, Xinyang, et al.
Pubblicazione: (2024)
IPCV: Information-Preserving Compression for MLLM Visual Encoders
di: Chen, Yuan, et al.
Pubblicazione: (2025)
di: Chen, Yuan, et al.
Pubblicazione: (2025)
Accelerating Streaming Video Large Language Models via Hierarchical Token Compression
di: Wang, Yiyu, et al.
Pubblicazione: (2025)
di: Wang, Yiyu, et al.
Pubblicazione: (2025)
Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding
di: Li, Yueying, et al.
Pubblicazione: (2026)
di: Li, Yueying, et al.
Pubblicazione: (2026)
STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models
di: Han, Yuhang, et al.
Pubblicazione: (2026)
di: Han, Yuhang, et al.
Pubblicazione: (2026)
Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance
di: Song, Wenxuan, et al.
Pubblicazione: (2026)
di: Song, Wenxuan, et al.
Pubblicazione: (2026)
TRIO: Token Reduction via Inference-Objective Guidance for Efficient Vision-Language Models
di: Zhang, Haokui, et al.
Pubblicazione: (2026)
di: Zhang, Haokui, et al.
Pubblicazione: (2026)
Rethinking Target Label Conditioning in Adversarial Attacks: A 2D Tensor-Guided Generative Approach
di: Liu, Hangyu, et al.
Pubblicazione: (2025)
di: Liu, Hangyu, et al.
Pubblicazione: (2025)
TAP: A Token-Adaptive Predictor Framework for Training-Free Diffusion Acceleration
di: Zhu, Haowei, et al.
Pubblicazione: (2026)
di: Zhu, Haowei, et al.
Pubblicazione: (2026)
Focus-Consistent Multi-Level Aggregation for Compositional Zero-Shot Learning
di: Dai, Fengyuan, et al.
Pubblicazione: (2024)
di: Dai, Fengyuan, et al.
Pubblicazione: (2024)
Exploring the Evolution of Physics Cognition in Video Generation: A Survey
di: Lin, Minghui, et al.
Pubblicazione: (2025)
di: Lin, Minghui, et al.
Pubblicazione: (2025)
Sparse-Tuning: Adapting Vision Transformers with Efficient Fine-tuning and Inference
di: Liu, Ting, et al.
Pubblicazione: (2024)
di: Liu, Ting, et al.
Pubblicazione: (2024)
Prompt-based Distribution Alignment for Unsupervised Domain Adaptation
di: Bai, Shuanghao, et al.
Pubblicazione: (2023)
di: Bai, Shuanghao, et al.
Pubblicazione: (2023)
Learning Disentangled Identifiers for Action-Customized Text-to-Image Generation
di: Huang, Siteng, et al.
Pubblicazione: (2023)
di: Huang, Siteng, et al.
Pubblicazione: (2023)
Beyond Filtering: Adaptive Image-Text Quality Enhancement for MLLM Pretraining
di: Huang, Han, et al.
Pubblicazione: (2024)
di: Huang, Han, et al.
Pubblicazione: (2024)
Training-free Token Reduction for Vision Mamba
di: Ma, Qiankun, et al.
Pubblicazione: (2025)
di: Ma, Qiankun, et al.
Pubblicazione: (2025)
D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning
di: Zhang, Evelyn, et al.
Pubblicazione: (2025)
di: Zhang, Evelyn, et al.
Pubblicazione: (2025)
Enhancing Adversarial Transferability via Component-Wise Transformation
di: Liu, Hangyu, et al.
Pubblicazione: (2025)
di: Liu, Hangyu, et al.
Pubblicazione: (2025)
Check, Locate, Rectify: A Training-Free Layout Calibration System for Text-to-Image Generation
di: Gong, Biao, et al.
Pubblicazione: (2023)
di: Gong, Biao, et al.
Pubblicazione: (2023)
Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models
di: Ke, Junlong, et al.
Pubblicazione: (2026)
di: Ke, Junlong, et al.
Pubblicazione: (2026)
CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models
di: Huang, Junming, et al.
Pubblicazione: (2026)
di: Huang, Junming, et al.
Pubblicazione: (2026)
FreeVA: Offline MLLM as Training-Free Video Assistant
di: Wu, Wenhao
Pubblicazione: (2024)
di: Wu, Wenhao
Pubblicazione: (2024)
Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding
di: Zhang, Renshan, et al.
Pubblicazione: (2024)
di: Zhang, Renshan, et al.
Pubblicazione: (2024)
Revisiting MLLM Token Technology through the Lens of Classical Visual Coding
di: Liu, Jinming, et al.
Pubblicazione: (2025)
di: Liu, Jinming, et al.
Pubblicazione: (2025)
OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation
di: Cui, Can, et al.
Pubblicazione: (2025)
di: Cui, Can, et al.
Pubblicazione: (2025)
ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
di: Liu, Xuyang, et al.
Pubblicazione: (2025) -
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
di: Chen, Junjie, et al.
Pubblicazione: (2025) -
VGDiffZero: Text-to-image Diffusion Models Can Be Zero-shot Visual Grounders
di: Liu, Xuyang, et al.
Pubblicazione: (2023) -
VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration
di: Yu, Hanxun, et al.
Pubblicazione: (2026) -
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
di: Liu, Yang, et al.
Pubblicazione: (2024)