Brain-Inspired Stepwise Patch Merging for Vision Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, Yonghao, Zhao, Dongcheng, Shen, Guobin, Dong, Yiting, Zeng, Yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EventZoom: A Progressive Approach to Event-Based Data Augmentation for Enhanced Neuromorphic Vision
di: Dong, Yiting, et al.
Pubblicazione: (2024)
di: Dong, Yiting, et al.
Pubblicazione: (2024)
Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning
di: He, Xiang, et al.
Pubblicazione: (2025)
di: He, Xiang, et al.
Pubblicazione: (2025)
TIM: An Efficient Temporal Interaction Module for Spiking Transformer
di: Shen, Sicheng, et al.
Pubblicazione: (2024)
di: Shen, Sicheng, et al.
Pubblicazione: (2024)
An Efficient Knowledge Transfer Strategy for Spiking Neural Networks from Static to Event Domain
di: He, Xiang, et al.
Pubblicazione: (2023)
di: He, Xiang, et al.
Pubblicazione: (2023)
CACE-Net: Co-guidance Attention and Contrastive Enhancement for Effective Audio-Visual Event Localization
di: He, Xiang, et al.
Pubblicazione: (2024)
di: He, Xiang, et al.
Pubblicazione: (2024)
Lossless Token Merging Even Without Fine-Tuning in Vision Transformers
di: Lee, Jaeyeon, et al.
Pubblicazione: (2025)
di: Lee, Jaeyeon, et al.
Pubblicazione: (2025)
DORA: Dynamic Online Reinforcement Agent for Token Merging in Vision Transformers
di: He, Kaixuan, et al.
Pubblicazione: (2026)
di: He, Kaixuan, et al.
Pubblicazione: (2026)
Ultra-High Resolution Segmentation via Boundary-Enhanced Patch-Merging Transformer
di: Sun, Haopeng, et al.
Pubblicazione: (2024)
di: Sun, Haopeng, et al.
Pubblicazione: (2024)
Retina Vision Transformer (RetinaViT): Introducing Scaled Patches into Vision Transformers
di: Shu, Yuyang, et al.
Pubblicazione: (2024)
di: Shu, Yuyang, et al.
Pubblicazione: (2024)
Quantum-Brain: Quantum-Inspired Neural Network Approach to Vision-Brain Understanding
di: Nguyen, Hoang-Quan, et al.
Pubblicazione: (2024)
di: Nguyen, Hoang-Quan, et al.
Pubblicazione: (2024)
MPM: Mutual Pair Merging for Efficient Vision Transformers
di: Ravé, Simon, et al.
Pubblicazione: (2026)
di: Ravé, Simon, et al.
Pubblicazione: (2026)
Dynamic Granularity Matters: Rethinking Vision Transformers Beyond Fixed Patch Splitting
di: Yu, Qiyang, et al.
Pubblicazione: (2025)
di: Yu, Qiyang, et al.
Pubblicazione: (2025)
Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers
di: Lee, Dong Hoon, et al.
Pubblicazione: (2024)
di: Lee, Dong Hoon, et al.
Pubblicazione: (2024)
When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models
di: Lu, Hui, et al.
Pubblicazione: (2025)
di: Lu, Hui, et al.
Pubblicazione: (2025)
Patch Rebirth: Toward Fast and Transferable Model Inversion of Vision Transformers
di: Heo, Seongsoo, et al.
Pubblicazione: (2025)
di: Heo, Seongsoo, et al.
Pubblicazione: (2025)
RobustMerge: Parameter-Efficient Model Merging for MLLMs with Direction Robustness
di: Zeng, Fanhu, et al.
Pubblicazione: (2025)
di: Zeng, Fanhu, et al.
Pubblicazione: (2025)
Exploring Vision Transformers for 3D Human Motion-Language Models with Motion Patches
di: Yu, Qing, et al.
Pubblicazione: (2024)
di: Yu, Qing, et al.
Pubblicazione: (2024)
Sliding-Window Merging for Compacting Patch-Redundant Layers in LLMs
di: Ding, Xuan, et al.
Pubblicazione: (2025)
di: Ding, Xuan, et al.
Pubblicazione: (2025)
Boosting the Robustness-Accuracy Trade-off of SNNs by Robust Temporal Self-Ensemble
di: Wang, Jihang, et al.
Pubblicazione: (2025)
di: Wang, Jihang, et al.
Pubblicazione: (2025)
Patch-Fool: Are Vision Transformers Always Robust Against Adversarial Perturbations?
di: Fu, Yonggan, et al.
Pubblicazione: (2022)
di: Fu, Yonggan, et al.
Pubblicazione: (2022)
Efficient Adaptation of Pre-trained Vision Transformer via Householder Transformation
di: Dong, Wei, et al.
Pubblicazione: (2024)
di: Dong, Wei, et al.
Pubblicazione: (2024)
FREE-Merging: Fourier Transform for Efficient Model Merging
di: Zheng, Shenghe, et al.
Pubblicazione: (2024)
di: Zheng, Shenghe, et al.
Pubblicazione: (2024)
MSPE: Multi-Scale Patch Embedding Prompts Vision Transformers to Any Resolution
di: Liu, Wenzhuo, et al.
Pubblicazione: (2024)
di: Liu, Wenzhuo, et al.
Pubblicazione: (2024)
Time Cell Inspired Temporal Codebook in Spiking Neural Networks for Enhanced Image Generation
di: Feng, Linghao, et al.
Pubblicazione: (2024)
di: Feng, Linghao, et al.
Pubblicazione: (2024)
SpikeStereoNet: A Brain-Inspired Framework for Stereo Depth Estimation from Spike Streams
di: Gao, Zhuoheng, et al.
Pubblicazione: (2025)
di: Gao, Zhuoheng, et al.
Pubblicazione: (2025)
Improved Ear Verification with Vision Transformers and Overlapping Patches
di: Arun, Deeksha, et al.
Pubblicazione: (2025)
di: Arun, Deeksha, et al.
Pubblicazione: (2025)
Semantic Graph Consistency: Going Beyond Patches for Regularizing Self-Supervised Vision Transformers
di: Devaguptapu, Chaitanya, et al.
Pubblicazione: (2024)
di: Devaguptapu, Chaitanya, et al.
Pubblicazione: (2024)
ALGM: Adaptive Local-then-Global Token Merging for Efficient Semantic Segmentation with Plain Vision Transformers
di: Norouzi, Narges, et al.
Pubblicazione: (2024)
di: Norouzi, Narges, et al.
Pubblicazione: (2024)
Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration
di: Zeng, Fanhu, et al.
Pubblicazione: (2025)
di: Zeng, Fanhu, et al.
Pubblicazione: (2025)
Brain3D: Brain Report Automation via Inflated Vision Transformers in 3D
di: Barone, Mariano, et al.
Pubblicazione: (2026)
di: Barone, Mariano, et al.
Pubblicazione: (2026)
Patch Pruning Strategy Based on Robust Statistical Measures of Attention Weight Diversity in Vision Transformers
di: Igaue, Yuki, et al.
Pubblicazione: (2025)
di: Igaue, Yuki, et al.
Pubblicazione: (2025)
PaW-ViT: A Patch-based Warping Vision Transformer for Robust Ear Verification
di: Arun, Deeksha, et al.
Pubblicazione: (2026)
di: Arun, Deeksha, et al.
Pubblicazione: (2026)
Adaptive MLP Pruning for Large Vision Transformers
di: Shen, Chengchao
Pubblicazione: (2026)
di: Shen, Chengchao
Pubblicazione: (2026)
Dynamic Patch-aware Enrichment Transformer for Occluded Person Re-Identification
di: Zhang, Xin, et al.
Pubblicazione: (2024)
di: Zhang, Xin, et al.
Pubblicazione: (2024)
Brain-Inspired Multimodal Spiking Neural Network for Image-Text Retrieval
di: Zong, Xintao, et al.
Pubblicazione: (2026)
di: Zong, Xintao, et al.
Pubblicazione: (2026)
EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm
di: Zhang, Jiangning, et al.
Pubblicazione: (2022)
di: Zhang, Jiangning, et al.
Pubblicazione: (2022)
Revisiting [CLS] and Patch Token Interaction in Vision Transformers
di: Marouani, Alexis, et al.
Pubblicazione: (2026)
di: Marouani, Alexis, et al.
Pubblicazione: (2026)
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
di: Qi, Yukun, et al.
Pubblicazione: (2026)
di: Qi, Yukun, et al.
Pubblicazione: (2026)
Efficient Adaptation of Pre-trained Vision Transformer underpinned by Approximately Orthogonal Fine-Tuning Strategy
di: Yang, Yiting, et al.
Pubblicazione: (2025)
di: Yang, Yiting, et al.
Pubblicazione: (2025)
Accelerating Vision Transformers with Adaptive Patch Sizes
di: Choudhury, Rohan, et al.
Pubblicazione: (2025)
di: Choudhury, Rohan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
EventZoom: A Progressive Approach to Event-Based Data Augmentation for Enhanced Neuromorphic Vision
di: Dong, Yiting, et al.
Pubblicazione: (2024) -
Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning
di: He, Xiang, et al.
Pubblicazione: (2025) -
TIM: An Efficient Temporal Interaction Module for Spiking Transformer
di: Shen, Sicheng, et al.
Pubblicazione: (2024) -
An Efficient Knowledge Transfer Strategy for Spiking Neural Networks from Static to Event Domain
di: He, Xiang, et al.
Pubblicazione: (2023) -
CACE-Net: Co-guidance Attention and Contrastive Enhancement for Effective Audio-Visual Event Localization
di: He, Xiang, et al.
Pubblicazione: (2024)