Block-based Symmetric Pruning and Fusion for Efficient Vision Transformers
Fuente:
arXiv
Saved in:
| Main Authors: | Hsieh, Yi-Kuan, Hsieh, Jun-Wei, Li, Xin, Chang, Yu-Ming, Tseng, Yu-Chee |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Partial Ring Scan: Revisiting Scan Order in Vision State Space Models
by: Hsieh, Yi-Kuan, et al.
Published: (2026)
by: Hsieh, Yi-Kuan, et al.
Published: (2026)
The Hard Positive Truth about Vision-Language Compositionality
by: Kamath, Amita, et al.
Published: (2024)
by: Kamath, Amita, et al.
Published: (2024)
FGFP: A Fractional Gaussian Filter and Pruning for Deep Neural Networks Compression
by: Tu, Kuan-Ting, et al.
Published: (2025)
by: Tu, Kuan-Ting, et al.
Published: (2025)
Pruning by Block Benefit: Exploring the Properties of Vision Transformer Blocks during Domain Adaptation
by: Glandorf, Patrick, et al.
Published: (2025)
by: Glandorf, Patrick, et al.
Published: (2025)
SMILEtrack: SiMIlarity LEarning for Occlusion-Aware Multiple Object Tracking
by: Wang, Yu-Hsiang, et al.
Published: (2022)
by: Wang, Yu-Hsiang, et al.
Published: (2022)
MicroViT: A Vision Transformer with Low Complexity Self Attention for Edge Device
by: Setyawan, Novendra, et al.
Published: (2025)
by: Setyawan, Novendra, et al.
Published: (2025)
MicroViTv2: Beyond the FLOPS for Edge Energy-Friendly Vision Transformers
by: Setyawan, Novendra, et al.
Published: (2026)
by: Setyawan, Novendra, et al.
Published: (2026)
TinyFormer: Preserving Tiny Objects in YOLO-DETR Hybrid Real-time Detectors
by: Hsieh, Jun-Wei, et al.
Published: (2026)
by: Hsieh, Jun-Wei, et al.
Published: (2026)
ReDiPrune: Relevance-Diversity Pre-Projection Token Pruning for Efficient Multimodal LLMs
by: Yu, An, et al.
Published: (2026)
by: Yu, An, et al.
Published: (2026)
HSViT: Horizontally Scalable Vision Transformer
by: Xu, Chenhao, et al.
Published: (2024)
by: Xu, Chenhao, et al.
Published: (2024)
FaceLiVT: Face Recognition using Linear Vision Transformer with Structural Reparameterization For Mobile Device
by: Setyawan, Novendra, et al.
Published: (2025)
by: Setyawan, Novendra, et al.
Published: (2025)
GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer
by: Jia, Ding, et al.
Published: (2024)
by: Jia, Ding, et al.
Published: (2024)
Fast-COS: A Fast One-Stage Object Detector Based on Reparameterized Attention Vision Transformer for Autonomous Driving
by: Setyawan, Novendra, et al.
Published: (2025)
by: Setyawan, Novendra, et al.
Published: (2025)
A Unified Transformer-Based Framework with Pretraining For Whole Body Grasping Motion Generation
by: Effendy, Edward, et al.
Published: (2025)
by: Effendy, Edward, et al.
Published: (2025)
PPT: Token Pruning and Pooling for Efficient Vision Transformers
by: Wu, Xinjian, et al.
Published: (2023)
by: Wu, Xinjian, et al.
Published: (2023)
RepSFNet : A Single Fusion Network with Structural Reparameterization for Crowd Counting
by: Achmadiah, Mas Nurul, et al.
Published: (2026)
by: Achmadiah, Mas Nurul, et al.
Published: (2026)
Multimodal Sentiment Analysis based on Multi-channel and Symmetric Mutual Promotion Feature Fusion
by: Zhu, Wangyuan, et al.
Published: (2026)
by: Zhu, Wangyuan, et al.
Published: (2026)
GM-Skip: Metric-Guided Transformer Block Skipping for Efficient Vision-Language Models
by: Huang, Lianming, et al.
Published: (2025)
by: Huang, Lianming, et al.
Published: (2025)
Semantic-Guided Natural Language and Visual Fusion for Cross-Modal Interaction Based on Tiny Object Detection
by: Huang, Xian-Hong, et al.
Published: (2025)
by: Huang, Xian-Hong, et al.
Published: (2025)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
by: Liu, Jizhihui, et al.
Published: (2025)
by: Liu, Jizhihui, et al.
Published: (2025)
ParFormer: A Vision Transformer with Parallel Mixer and Sparse Channel Attention Patch Embedding
by: Setyawan, Novendra, et al.
Published: (2024)
by: Setyawan, Novendra, et al.
Published: (2024)
Adaptively Bypassing Vision Transformer Blocks for Efficient Visual Tracking
by: Yang, Xiangyang, et al.
Published: (2024)
by: Yang, Xiangyang, et al.
Published: (2024)
Towards Joint Quantization and Token Pruning of Vision-Language Models
by: Li, Xinqing, et al.
Published: (2026)
by: Li, Xinqing, et al.
Published: (2026)
CSAD: Unsupervised Component Segmentation for Logical Anomaly Detection
by: Hsieh, Yu-Hsuan, et al.
Published: (2024)
by: Hsieh, Yu-Hsuan, et al.
Published: (2024)
VSFormer: Visual-Spatial Fusion Transformer for Correspondence Pruning
by: Liao, Tangfei, et al.
Published: (2023)
by: Liao, Tangfei, et al.
Published: (2023)
Block Pruning for Enhanced Efficiency in Convolutional Neural Networks
by: Wu, Cheng-En, et al.
Published: (2023)
by: Wu, Cheng-En, et al.
Published: (2023)
Reinforcement Learning-based Token Pruning in Vision Transformers: A Markov Game Approach
by: Lu, Chenglong, et al.
Published: (2025)
by: Lu, Chenglong, et al.
Published: (2025)
GCC: Generative Color Constancy via Diffusing a Color Checker
by: Chang, Chen-Wei, et al.
Published: (2025)
by: Chang, Chen-Wei, et al.
Published: (2025)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
by: Cao, Jianjian, et al.
Published: (2024)
by: Cao, Jianjian, et al.
Published: (2024)
Mixed Text Recognition with Efficient Parameter Fine-Tuning and Transformer
by: Chang, Da, et al.
Published: (2024)
by: Chang, Da, et al.
Published: (2024)
PTT: Point-Trajectory Transformer for Efficient Temporal 3D Object Detection
by: Huang, Kuan-Chih, et al.
Published: (2023)
by: Huang, Kuan-Chih, et al.
Published: (2023)
Rényi Entropy: A New Token Pruning Metric for Vision Transformers
by: Su, Wei-Yuan, et al.
Published: (2026)
by: Su, Wei-Yuan, et al.
Published: (2026)
InstantStyleGaussian: Efficient Art Style Transfer with 3D Gaussian Splatting
by: Yu, Xin-Yi, et al.
Published: (2024)
by: Yu, Xin-Yi, et al.
Published: (2024)
Adaptive MLP Pruning for Large Vision Transformers
by: Shen, Chengchao
Published: (2026)
by: Shen, Chengchao
Published: (2026)
SpectroMotion: Dynamic 3D Reconstruction of Specular Scenes
by: Fan, Cheng-De, et al.
Published: (2024)
by: Fan, Cheng-De, et al.
Published: (2024)
Neural Network-Based Tracking and 3D Reconstruction of Baseball Pitch Trajectories from Single-View 2D Video
by: Hsieh, Jhen
Published: (2024)
by: Hsieh, Jhen
Published: (2024)
HEART-VIT: Hessian-Guided Efficient Dynamic Attention and Token Pruning in Vision Transformer
by: Uddin, Mohammad Helal, et al.
Published: (2025)
by: Uddin, Mohammad Helal, et al.
Published: (2025)
A Simple yet Effective Network based on Vision Transformer for Camouflaged Object and Salient Object Detection
by: Hao, Chao, et al.
Published: (2024)
by: Hao, Chao, et al.
Published: (2024)
FedKLPR: KL-Guided Pruning-Aware Federated Learning for Person Re-Identification
by: Yu, Po-Hsien, et al.
Published: (2025)
by: Yu, Po-Hsien, et al.
Published: (2025)
FaceLiVTv2: An Improved Hybrid Architecture for Efficient Mobile Face Recognition
by: Setyawan, Novendra, et al.
Published: (2026)
by: Setyawan, Novendra, et al.
Published: (2026)
Similar Items
-
Partial Ring Scan: Revisiting Scan Order in Vision State Space Models
by: Hsieh, Yi-Kuan, et al.
Published: (2026) -
The Hard Positive Truth about Vision-Language Compositionality
by: Kamath, Amita, et al.
Published: (2024) -
FGFP: A Fractional Gaussian Filter and Pruning for Deep Neural Networks Compression
by: Tu, Kuan-Ting, et al.
Published: (2025) -
Pruning by Block Benefit: Exploring the Properties of Vision Transformer Blocks during Domain Adaptation
by: Glandorf, Patrick, et al.
Published: (2025) -
SMILEtrack: SiMIlarity LEarning for Occlusion-Aware Multiple Object Tracking
by: Wang, Yu-Hsiang, et al.
Published: (2022)