Vote&Mix: Plug-and-Play Token Reduction for Efficient Vision Transformer
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Peng, Shuai, Fu, Di, Wei, Baole, Cao, Yong, Gao, Liangcai, Tang, Zhi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition
von: Li, Yu, et al.
Veröffentlicht: (2025)
von: Li, Yu, et al.
Veröffentlicht: (2025)
SegHist: A General Segmentation-based Framework for Chinese Historical Document Text Line Detection
von: Hu, Xingjian, et al.
Veröffentlicht: (2024)
von: Hu, Xingjian, et al.
Veröffentlicht: (2024)
MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers
von: Bae, Jongseong, et al.
Veröffentlicht: (2024)
von: Bae, Jongseong, et al.
Veröffentlicht: (2024)
Frequency-Aware Token Reduction for Efficient Vision Transformer
von: Lee, Dong-Jae, et al.
Veröffentlicht: (2025)
von: Lee, Dong-Jae, et al.
Veröffentlicht: (2025)
ReMA: A Training-Free Plug-and-Play Mixing Augmentation for Video Behavior Recognition
von: Cui, Feng-Qi, et al.
Veröffentlicht: (2026)
von: Cui, Feng-Qi, et al.
Veröffentlicht: (2026)
PSTTS: A Plug-and-Play Token Selector for Efficient Event-based Spatio-temporal Representation Learning
von: Zhao, Xiangmo, et al.
Veröffentlicht: (2025)
von: Zhao, Xiangmo, et al.
Veröffentlicht: (2025)
Plug-and-Play Diffusion Distillation
von: Hsiao, Yi-Ting, et al.
Veröffentlicht: (2024)
von: Hsiao, Yi-Ting, et al.
Veröffentlicht: (2024)
FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning
von: Cao, Jiajun, et al.
Veröffentlicht: (2025)
von: Cao, Jiajun, et al.
Veröffentlicht: (2025)
Plug-and-Play Fidelity Optimization for Diffusion Transformer Acceleration via Cumulative Error Minimization
von: Shao, Tong, et al.
Veröffentlicht: (2025)
von: Shao, Tong, et al.
Veröffentlicht: (2025)
PAT-VCM: Plug-and-Play Auxiliary Tokens for Video Coding for Machines
von: Jiang, Wei, et al.
Veröffentlicht: (2026)
von: Jiang, Wei, et al.
Veröffentlicht: (2026)
An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models
von: Chen, Liang, et al.
Veröffentlicht: (2024)
von: Chen, Liang, et al.
Veröffentlicht: (2024)
Diffusion Sampling Path Tells More: An Efficient Plug-and-Play Strategy for Sample Filtering
von: Wang, Sixian, et al.
Veröffentlicht: (2025)
von: Wang, Sixian, et al.
Veröffentlicht: (2025)
Plug-and-Play Context Feature Reuse for Efficient Masked Generation
von: Liu, Xuejie, et al.
Veröffentlicht: (2025)
von: Liu, Xuejie, et al.
Veröffentlicht: (2025)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
von: Cao, Jianjian, et al.
Veröffentlicht: (2024)
von: Cao, Jianjian, et al.
Veröffentlicht: (2024)
Anatomical Region-Guided Contrastive Decoding: A Plug-and-Play Strategy for Mitigating Hallucinations in Medical VLMs
von: Liang, Xiao, et al.
Veröffentlicht: (2025)
von: Liang, Xiao, et al.
Veröffentlicht: (2025)
Vision Transformer with Super Token Sampling
von: Huang, Huaibo, et al.
Veröffentlicht: (2022)
von: Huang, Huaibo, et al.
Veröffentlicht: (2022)
Training-free Token Reduction for Vision Mamba
von: Ma, Qiankun, et al.
Veröffentlicht: (2025)
von: Ma, Qiankun, et al.
Veröffentlicht: (2025)
MambaST: A Plug-and-Play Cross-Spectral Spatial-Temporal Fuser for Efficient Pedestrian Detection
von: Gao, Xiangbo, et al.
Veröffentlicht: (2024)
von: Gao, Xiangbo, et al.
Veröffentlicht: (2024)
A Plug-and-Play Method for Rare Human-Object Interactions Detection by Bridging Domain Gap
von: Zhang, Lijun, et al.
Veröffentlicht: (2024)
von: Zhang, Lijun, et al.
Veröffentlicht: (2024)
Flash-VAED: Plug-and-Play VAE Decoders for Efficient Video Generation
von: Zhu, Lunjie, et al.
Veröffentlicht: (2026)
von: Zhu, Lunjie, et al.
Veröffentlicht: (2026)
P$^2$HCT: Plug-and-Play Hierarchical C2F Transformer for Multi-Scale Feature Fusion
von: Hu, Junyi, et al.
Veröffentlicht: (2025)
von: Hu, Junyi, et al.
Veröffentlicht: (2025)
TRIO: Token Reduction via Inference-Objective Guidance for Efficient Vision-Language Models
von: Zhang, Haokui, et al.
Veröffentlicht: (2026)
von: Zhang, Haokui, et al.
Veröffentlicht: (2026)
From Camera to World: A Plug-and-Play Module for Human Mesh Transformation
von: Ma, Changhai, et al.
Veröffentlicht: (2025)
von: Ma, Changhai, et al.
Veröffentlicht: (2025)
Neighbor-Aware Token Reduction via Hilbert Curve for Vision Transformers
von: Li, Yunge, et al.
Veröffentlicht: (2025)
von: Li, Yunge, et al.
Veröffentlicht: (2025)
Token Compensator: Altering Inference Cost of Vision Transformer without Re-Tuning
von: Jie, Shibo, et al.
Veröffentlicht: (2024)
von: Jie, Shibo, et al.
Veröffentlicht: (2024)
Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration
von: Zeng, Fanhu, et al.
Veröffentlicht: (2025)
von: Zeng, Fanhu, et al.
Veröffentlicht: (2025)
Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness
von: Hu, Xin, et al.
Veröffentlicht: (2026)
von: Hu, Xin, et al.
Veröffentlicht: (2026)
Plug-and-Play Logit Fusion for Heterogeneous Pathology Foundation Models
von: Huang, Gexin, et al.
Veröffentlicht: (2026)
von: Huang, Gexin, et al.
Veröffentlicht: (2026)
PPT: Token Pruning and Pooling for Efficient Vision Transformers
von: Wu, Xinjian, et al.
Veröffentlicht: (2023)
von: Wu, Xinjian, et al.
Veröffentlicht: (2023)
CleanStyle: Plug-and-Play Style Conditioning Purification for Text-to-Image Stylization
von: Feng, Xiaoman, et al.
Veröffentlicht: (2026)
von: Feng, Xiaoman, et al.
Veröffentlicht: (2026)
ConvRot: Rotation-Based Plug-and-Play 4-bit Quantization for Diffusion Transformers
von: Huang, Feice, et al.
Veröffentlicht: (2025)
von: Huang, Feice, et al.
Veröffentlicht: (2025)
Clair Obscur: an Illumination-Aware Method for Real-World Image Vectorization
von: Lin, Xingyue, et al.
Veröffentlicht: (2025)
von: Lin, Xingyue, et al.
Veröffentlicht: (2025)
Plug-and-Play Versatile Compressed Video Enhancement
von: Zeng, Huimin, et al.
Veröffentlicht: (2025)
von: Zeng, Huimin, et al.
Veröffentlicht: (2025)
PhysDepth: Plug-and-Play Physical Refinement for Monocular Depth Estimation in Challenging Environments
von: Peng, Kebin, et al.
Veröffentlicht: (2024)
von: Peng, Kebin, et al.
Veröffentlicht: (2024)
Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding
von: Tang, Yutao, et al.
Veröffentlicht: (2025)
von: Tang, Yutao, et al.
Veröffentlicht: (2025)
The Loupe: A Plug-and-Play Attention Module for Amplifying Discriminative Features in Vision Transformers
von: Sengodan, Naren
Veröffentlicht: (2025)
von: Sengodan, Naren
Veröffentlicht: (2025)
Token-Space Mask Prediction for Efficient Vision Transformer Segmentation
von: Galagain, Calvin, et al.
Veröffentlicht: (2026)
von: Galagain, Calvin, et al.
Veröffentlicht: (2026)
ToSA: Token Selective Attention for Efficient Vision Transformers
von: Singh, Manish Kumar, et al.
Veröffentlicht: (2024)
von: Singh, Manish Kumar, et al.
Veröffentlicht: (2024)
Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation
von: Xue, Bowen, et al.
Veröffentlicht: (2025)
von: Xue, Bowen, et al.
Veröffentlicht: (2025)
SketchRef: a Multi-Task Evaluation Benchmark for Sketch Synthesis
von: Lin, Xingyue, et al.
Veröffentlicht: (2024)
von: Lin, Xingyue, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition
von: Li, Yu, et al.
Veröffentlicht: (2025) -
SegHist: A General Segmentation-based Framework for Chinese Historical Document Text Line Detection
von: Hu, Xingjian, et al.
Veröffentlicht: (2024) -
MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers
von: Bae, Jongseong, et al.
Veröffentlicht: (2024) -
Frequency-Aware Token Reduction for Efficient Vision Transformer
von: Lee, Dong-Jae, et al.
Veröffentlicht: (2025) -
ReMA: A Training-Free Plug-and-Play Mixing Augmentation for Video Behavior Recognition
von: Cui, Feng-Qi, et al.
Veröffentlicht: (2026)