Efficient Visual Transformer by Learnable Token Merging
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yancheng, Yang, Yingzhen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Compact Vision Transformer by Reduction of Kernel Complexity
por: Wang, Yancheng, et al.
Publicado: (2025)
por: Wang, Yancheng, et al.
Publicado: (2025)
Learning Informative Attention Weights for Person Re-Identification
por: Wang, Yancheng, et al.
Publicado: (2025)
por: Wang, Yancheng, et al.
Publicado: (2025)
RNAS-CL: Robust Neural Architecture Search by Cross-Layer Knowledge Distillation
por: Nath, Utkarsh, et al.
Publicado: (2023)
por: Nath, Utkarsh, et al.
Publicado: (2023)
Learning Low-Rank Feature for Thorax Disease Classification
por: Goel, Rajeev, et al.
Publicado: (2024)
por: Goel, Rajeev, et al.
Publicado: (2024)
CubistMerge: Spatial-Preserving Token Merging For Diverse ViT Backbones
por: Gong, Wenyi, et al.
Publicado: (2025)
por: Gong, Wenyi, et al.
Publicado: (2025)
Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding
por: Zhang, Yiming, et al.
Publicado: (2024)
por: Zhang, Yiming, et al.
Publicado: (2024)
Adaptive Token Merging for Efficient Transformer Semantic Communication at the Edge
por: Erak, Omar, et al.
Publicado: (2025)
por: Erak, Omar, et al.
Publicado: (2025)
TORE: Token Recycling in Vision Transformers for Efficient Active Visual Exploration
por: Olszewski, Jan, et al.
Publicado: (2023)
por: Olszewski, Jan, et al.
Publicado: (2023)
Segformer++: Efficient Token-Merging Strategies for High-Resolution Semantic Segmentation
por: Kienzle, Daniel, et al.
Publicado: (2024)
por: Kienzle, Daniel, et al.
Publicado: (2024)
AdaMerging: Adaptive Model Merging for Multi-Task Learning
por: Yang, Enneng, et al.
Publicado: (2023)
por: Yang, Enneng, et al.
Publicado: (2023)
StructSAM: Structure- and Spectrum-Preserving Token Merging for Segment Anything Models
por: Nguyen, Duy M. H., et al.
Publicado: (2026)
por: Nguyen, Duy M. H., et al.
Publicado: (2026)
On the Role of Discrete Tokenization in Visual Representation Learning
por: Du, Tianqi, et al.
Publicado: (2024)
por: Du, Tianqi, et al.
Publicado: (2024)
Subtractive Modulative Network with Learnable Periodic Activations
por: Wang, Tiou, et al.
Publicado: (2026)
por: Wang, Tiou, et al.
Publicado: (2026)
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
por: Zhang, Dingkun, et al.
Publicado: (2026)
por: Zhang, Dingkun, et al.
Publicado: (2026)
Transformers with Joint Tokens and Local-Global Attention for Efficient Human Pose Estimation
por: Kinfu, Kaleab A., et al.
Publicado: (2025)
por: Kinfu, Kaleab A., et al.
Publicado: (2025)
ToFe: Lagged Token Freezing and Reusing for Efficient Vision Transformer Inference
por: Zhang, Haoyue, et al.
Publicado: (2025)
por: Zhang, Haoyue, et al.
Publicado: (2025)
BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary Codebook
por: Gu, Hao, et al.
Publicado: (2025)
por: Gu, Hao, et al.
Publicado: (2025)
Efficient Multi-Source Knowledge Transfer by Model Merging
por: Osial, Marcin, et al.
Publicado: (2025)
por: Osial, Marcin, et al.
Publicado: (2025)
Uncertainty-Aware Token Importance Estimation in Spiking Transformers
por: Liu, Wenxuan, et al.
Publicado: (2026)
por: Liu, Wenxuan, et al.
Publicado: (2026)
Introducing Visual Perception Token into Multimodal Large Language Model
por: Yu, Runpeng, et al.
Publicado: (2025)
por: Yu, Runpeng, et al.
Publicado: (2025)
Efficient and Effective Weight-Ensembling Mixture of Experts for Multi-Task Model Merging
por: Shen, Li, et al.
Publicado: (2024)
por: Shen, Li, et al.
Publicado: (2024)
Stay Unique, Stay Efficient: Preserving Model Personality in Multi-Task Merging
por: Guo, Kuangpu, et al.
Publicado: (2025)
por: Guo, Kuangpu, et al.
Publicado: (2025)
Token Caching for Diffusion Transformer Acceleration
por: Lou, Jinming, et al.
Publicado: (2024)
por: Lou, Jinming, et al.
Publicado: (2024)
Unified Autoregressive Visual Generation and Understanding with Continuous Tokens
por: Fan, Lijie, et al.
Publicado: (2025)
por: Fan, Lijie, et al.
Publicado: (2025)
On the Learnability of Out-of-distribution Detection
por: Fang, Zhen, et al.
Publicado: (2024)
por: Fang, Zhen, et al.
Publicado: (2024)
Your Image is Secretly the Last Frame of a Pseudo Video
por: Chen, Wenlong, et al.
Publicado: (2024)
por: Chen, Wenlong, et al.
Publicado: (2024)
CodeMerge: Codebook-Guided Model Merging for Robust Test-Time Adaptation in Autonomous Driving
por: Yang, Huitong, et al.
Publicado: (2025)
por: Yang, Huitong, et al.
Publicado: (2025)
Compressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic Manipulation
por: Gao, Juntao, et al.
Publicado: (2025)
por: Gao, Juntao, et al.
Publicado: (2025)
SPoT: Subpixel Placement of Tokens in Vision Transformers
por: Hjelkrem-Tan, Martine, et al.
Publicado: (2025)
por: Hjelkrem-Tan, Martine, et al.
Publicado: (2025)
DC-Merge: Improving Model Merging with Directional Consistency
por: Zhang, Han-Chen, et al.
Publicado: (2026)
por: Zhang, Han-Chen, et al.
Publicado: (2026)
Model Debiasing by Learnable Data Augmentation
por: Morerio, Pietro, et al.
Publicado: (2024)
por: Morerio, Pietro, et al.
Publicado: (2024)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
por: Zhang, Luyuan, et al.
Publicado: (2026)
por: Zhang, Luyuan, et al.
Publicado: (2026)
D$^{3}$ToM: Decider-Guided Dynamic Token Merging for Accelerating Diffusion MLLMs
por: Chang, Shuochen, et al.
Publicado: (2025)
por: Chang, Shuochen, et al.
Publicado: (2025)
Merging and Disentangling Views in Visual Reinforcement Learning for Robotic Manipulation
por: Almuzairee, Abdulaziz, et al.
Publicado: (2025)
por: Almuzairee, Abdulaziz, et al.
Publicado: (2025)
EMR-Merging: Tuning-Free High-Performance Model Merging
por: Huang, Chenyu, et al.
Publicado: (2024)
por: Huang, Chenyu, et al.
Publicado: (2024)
AdaPerceiver: Transformers with Adaptive Width, Depth, and Tokens
por: Jajal, Purvish, et al.
Publicado: (2025)
por: Jajal, Purvish, et al.
Publicado: (2025)
H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers
por: Li, Wenhao, et al.
Publicado: (2025)
por: Li, Wenhao, et al.
Publicado: (2025)
Hourglass Tokenizer for Efficient Transformer-Based 3D Human Pose Estimation
por: Li, Wenhao, et al.
Publicado: (2023)
por: Li, Wenhao, et al.
Publicado: (2023)
Token Turing Machines are Efficient Vision Models
por: Jajal, Purvish, et al.
Publicado: (2024)
por: Jajal, Purvish, et al.
Publicado: (2024)
PaCX-MAE: Physiology-Augmented Chest X-Ray Masked Autoencoder
por: Liu, Yancheng, et al.
Publicado: (2026)
por: Liu, Yancheng, et al.
Publicado: (2026)
Ejemplares similares
-
Compact Vision Transformer by Reduction of Kernel Complexity
por: Wang, Yancheng, et al.
Publicado: (2025) -
Learning Informative Attention Weights for Person Re-Identification
por: Wang, Yancheng, et al.
Publicado: (2025) -
RNAS-CL: Robust Neural Architecture Search by Cross-Layer Knowledge Distillation
por: Nath, Utkarsh, et al.
Publicado: (2023) -
Learning Low-Rank Feature for Thorax Disease Classification
por: Goel, Rajeev, et al.
Publicado: (2024) -
CubistMerge: Spatial-Preserving Token Merging For Diverse ViT Backbones
por: Gong, Wenyi, et al.
Publicado: (2025)