Training-free Token Reduction for Vision Mamba
Fuente:
arXiv
Saved in:
| Main Authors: | Ma, Qiankun, Zhang, Ziyao, Su, Chi, Chen, Jie, Song, Zhen, Zheng, Hairong, Gao, Wen |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ApET: Approximation-Error Guided Token Compression for Efficient VLMs
by: Ma, Qiankun, et al.
Published: (2026)
by: Ma, Qiankun, et al.
Published: (2026)
MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation
by: Chen, Wenchao, et al.
Published: (2024)
by: Chen, Wenchao, et al.
Published: (2024)
Spark3R: Asymmetric Token Reduction Makes Fast Feed-Forward 3D Reconstruction
by: Tang, Zecheng, et al.
Published: (2026)
by: Tang, Zecheng, et al.
Published: (2026)
GlobalMamba: Global Image Serialization for Vision Mamba
by: Wang, Chengkun, et al.
Published: (2024)
by: Wang, Chengkun, et al.
Published: (2024)
HiCoM: Hierarchical Coherent Motion for Streamable Dynamic Scene with 3D Gaussian Splatting
by: Gao, Qiankun, et al.
Published: (2024)
by: Gao, Qiankun, et al.
Published: (2024)
Rethinking Token Reduction for Large Vision-Language Models
by: Wang, Yi, et al.
Published: (2026)
by: Wang, Yi, et al.
Published: (2026)
UAVD-Mamba: Deformable Token Fusion Vision Mamba for Multimodal UAV Detection
by: Li, Wei, et al.
Published: (2025)
by: Li, Wei, et al.
Published: (2025)
On the Limits of Token Reduction for Efficient Unified Vision Language Training
by: Chen, Siyi, et al.
Published: (2026)
by: Chen, Siyi, et al.
Published: (2026)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
by: Wang, Ziyao, et al.
Published: (2026)
by: Wang, Ziyao, et al.
Published: (2026)
Demystify Mamba in Vision: A Linear Attention Perspective
by: Han, Dongchen, et al.
Published: (2024)
by: Han, Dongchen, et al.
Published: (2024)
VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration
by: Yu, Hanxun, et al.
Published: (2026)
by: Yu, Hanxun, et al.
Published: (2026)
Rényi Entropy: A New Token Pruning Metric for Vision Transformers
by: Su, Wei-Yuan, et al.
Published: (2026)
by: Su, Wei-Yuan, et al.
Published: (2026)
FD-Vision Mamba for Endoscopic Exposure Correction
by: Zheng, Zhuoran, et al.
Published: (2024)
by: Zheng, Zhuoran, et al.
Published: (2024)
U-shaped Vision Mamba for Single Image Dehazing
by: Zheng, Zhuoran, et al.
Published: (2024)
by: Zheng, Zhuoran, et al.
Published: (2024)
Vision SmolMamba: Spike-Guided Token Pruning for Energy-Efficient Spiking State-Space Vision Models
by: Bai, Dewei, et al.
Published: (2026)
by: Bai, Dewei, et al.
Published: (2026)
Vision Foundation Models as Generalist Tokenizers for Image Generation
by: Zheng, Anlin, et al.
Published: (2026)
by: Zheng, Anlin, et al.
Published: (2026)
Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration
by: Han, Yuhang, et al.
Published: (2024)
by: Han, Yuhang, et al.
Published: (2024)
Vote&Mix: Plug-and-Play Token Reduction for Efficient Vision Transformer
by: Peng, Shuai, et al.
Published: (2024)
by: Peng, Shuai, et al.
Published: (2024)
Stochastic Layer-Wise Shuffle for Improving Vision Mamba Training
by: Huang, Zizheng, et al.
Published: (2024)
by: Huang, Zizheng, et al.
Published: (2024)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
by: Zhang, Ce, et al.
Published: (2025)
by: Zhang, Ce, et al.
Published: (2025)
Improving Autoregressive Image Generation through Coarse-to-Fine Token Prediction
by: Guo, Ziyao, et al.
Published: (2025)
by: Guo, Ziyao, et al.
Published: (2025)
Mamba-in-Mamba: Centralized Mamba-Cross-Scan in Tokenized Mamba Model for Hyperspectral Image Classification
by: Zhou, Weilian, et al.
Published: (2024)
by: Zhou, Weilian, et al.
Published: (2024)
Famba-V: Fast Vision Mamba with Cross-Layer Token Fusion
by: Shen, Hui, et al.
Published: (2024)
by: Shen, Hui, et al.
Published: (2024)
SAT-HMR: Real-Time Multi-Person 3D Mesh Estimation via Scale-Adaptive Tokens
by: Su, Chi, et al.
Published: (2024)
by: Su, Chi, et al.
Published: (2024)
Multi-Token Enhancing for Vision Representation Learning
by: Li, Zhong-Yu, et al.
Published: (2024)
by: Li, Zhong-Yu, et al.
Published: (2024)
MambaMIM: Pre-training Mamba with State Space Token Interpolation and its Application to Medical Image Segmentation
by: Tang, Fenghe, et al.
Published: (2024)
by: Tang, Fenghe, et al.
Published: (2024)
TinyViM: Frequency Decoupling for Tiny Hybrid Vision Mamba
by: Ma, Xiaowen, et al.
Published: (2024)
by: Ma, Xiaowen, et al.
Published: (2024)
ToFe: Lagged Token Freezing and Reusing for Efficient Vision Transformer Inference
by: Zhang, Haoyue, et al.
Published: (2025)
by: Zhang, Haoyue, et al.
Published: (2025)
[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs
by: Wang, Ao, et al.
Published: (2024)
by: Wang, Ao, et al.
Published: (2024)
MambaVision: A Hybrid Mamba-Transformer Vision Backbone
by: Hatamizadeh, Ali, et al.
Published: (2024)
by: Hatamizadeh, Ali, et al.
Published: (2024)
Matten: Video Generation with Mamba-Attention
by: Gao, Yu, et al.
Published: (2024)
by: Gao, Yu, et al.
Published: (2024)
Robust Tracking via Mamba-based Context-aware Token Learning
by: Xie, Jinxia, et al.
Published: (2024)
by: Xie, Jinxia, et al.
Published: (2024)
ConMamba: Contrastive Vision Mamba for Plant Disease Detection
by: Mamun, Abdullah Al, et al.
Published: (2025)
by: Mamun, Abdullah Al, et al.
Published: (2025)
ResCLIP: Residual Attention for Training-free Dense Vision-language Inference
by: Yang, Yuhang, et al.
Published: (2024)
by: Yang, Yuhang, et al.
Published: (2024)
TRIO: Token Reduction via Inference-Objective Guidance for Efficient Vision-Language Models
by: Zhang, Haokui, et al.
Published: (2026)
by: Zhang, Haokui, et al.
Published: (2026)
RelayGS: Reconstructing Dynamic Scenes with Large-Scale and Complex Motions via Relay Gaussians
by: Gao, Qiankun, et al.
Published: (2024)
by: Gao, Qiankun, et al.
Published: (2024)
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
by: Chen, Junjie, et al.
Published: (2025)
by: Chen, Junjie, et al.
Published: (2025)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
by: Zhao, Shiyu, et al.
Published: (2024)
by: Zhao, Shiyu, et al.
Published: (2024)
VLMQ: Token Saliency-Driven Post-Training Quantization for Vision-language Models
by: Xue, Yufei, et al.
Published: (2025)
by: Xue, Yufei, et al.
Published: (2025)
Neighbor-Aware Token Reduction via Hilbert Curve for Vision Transformers
by: Li, Yunge, et al.
Published: (2025)
by: Li, Yunge, et al.
Published: (2025)
Similar Items
-
ApET: Approximation-Error Guided Token Compression for Efficient VLMs
by: Ma, Qiankun, et al.
Published: (2026) -
MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation
by: Chen, Wenchao, et al.
Published: (2024) -
Spark3R: Asymmetric Token Reduction Makes Fast Feed-Forward 3D Reconstruction
by: Tang, Zecheng, et al.
Published: (2026) -
GlobalMamba: Global Image Serialization for Vision Mamba
by: Wang, Chengkun, et al.
Published: (2024) -
HiCoM: Hierarchical Coherent Motion for Streamable Dynamic Scene with 3D Gaussian Splatting
by: Gao, Qiankun, et al.
Published: (2024)