Pruning One More Token is Enough: Leveraging Latency-Workload Non-Linearities for Vision Transformers on the Edge
Fuente:
arXiv
Salvato in:
| Autori principali: | Eliopoulos, Nick John, Jajal, Purvish, Davis, James C., Liu, Gaowen, Thiravathukal, George K., Lu, Yung-Hsiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Token Turing Machines are Efficient Vision Models
di: Jajal, Purvish, et al.
Pubblicazione: (2024)
di: Jajal, Purvish, et al.
Pubblicazione: (2024)
AdaPerceiver: Transformers with Adaptive Width, Depth, and Tokens
di: Jajal, Purvish, et al.
Pubblicazione: (2025)
di: Jajal, Purvish, et al.
Pubblicazione: (2025)
Inference-Time Alignment of Diffusion Models via Evolutionary Algorithms
di: Jajal, Purvish, et al.
Pubblicazione: (2025)
di: Jajal, Purvish, et al.
Pubblicazione: (2025)
LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection
di: Chou, Benjamin Shiue-Hal, et al.
Pubblicazione: (2025)
di: Chou, Benjamin Shiue-Hal, et al.
Pubblicazione: (2025)
Detecting Music Performance Errors with Transformers
di: Chou, Benjamin Shiue-Hal, et al.
Pubblicazione: (2025)
di: Chou, Benjamin Shiue-Hal, et al.
Pubblicazione: (2025)
Analysis of Failures and Risks in Deep Learning Model Converters: A Case Study in the ONNX Ecosystem
di: Jajal, Purvish, et al.
Pubblicazione: (2023)
di: Jajal, Purvish, et al.
Pubblicazione: (2023)
Reusing Deep Learning Models: Challenges and Directions in Software Engineering
di: Davis, James C., et al.
Pubblicazione: (2024)
di: Davis, James C., et al.
Pubblicazione: (2024)
Enfermería geri trica y gerontológica / Charlotte, Eliopoulos ; traductor, Félix García Roig, Ana Leticia Pacheco Perdiz, Néstor Zumaya C rdenas
di: Eliopoulos, Charlotte
Pubblicazione: (2019)
di: Eliopoulos, Charlotte
Pubblicazione: (2019)
SEUF: Is Unlearning One Expert Enough for Mixture-of-Experts LLMs?
di: Zhuang, Haomin, et al.
Pubblicazione: (2024)
di: Zhuang, Haomin, et al.
Pubblicazione: (2024)
PPT: Token Pruning and Pooling for Efficient Vision Transformers
di: Wu, Xinjian, et al.
Pubblicazione: (2023)
di: Wu, Xinjian, et al.
Pubblicazione: (2023)
Reinforcement Learning-based Token Pruning in Vision Transformers: A Markov Game Approach
di: Lu, Chenglong, et al.
Pubblicazione: (2025)
di: Lu, Chenglong, et al.
Pubblicazione: (2025)
Attention Reveals More Than Tokens: Training-Free Long-Context Reasoning with Attention-guided Retrieval
di: Zhang, Yuwei, et al.
Pubblicazione: (2025)
di: Zhang, Yuwei, et al.
Pubblicazione: (2025)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
di: Cao, Jianjian, et al.
Pubblicazione: (2024)
di: Cao, Jianjian, et al.
Pubblicazione: (2024)
One Token Is Enough: Improving Diffusion Language Models with a Sink Token
di: Zhang, Zihou, et al.
Pubblicazione: (2026)
di: Zhang, Zihou, et al.
Pubblicazione: (2026)
MDP: Multidimensional Vision Model Pruning with Latency Constraint
di: Sun, Xinglong, et al.
Pubblicazione: (2025)
di: Sun, Xinglong, et al.
Pubblicazione: (2025)
Large Language Models for Energy-Efficient Code: Emerging Results and Future Directions
di: Peng, Huiyun, et al.
Pubblicazione: (2024)
di: Peng, Huiyun, et al.
Pubblicazione: (2024)
MULTIFLOW: Shifting Towards Task-Agnostic Vision-Language Pruning
di: Farina, Matteo, et al.
Pubblicazione: (2024)
di: Farina, Matteo, et al.
Pubblicazione: (2024)
Rényi Entropy: A New Token Pruning Metric for Vision Transformers
di: Su, Wei-Yuan, et al.
Pubblicazione: (2026)
di: Su, Wei-Yuan, et al.
Pubblicazione: (2026)
Token Pruning using a Lightweight Background Aware Vision Transformer
di: Sah, Sudhakar, et al.
Pubblicazione: (2024)
di: Sah, Sudhakar, et al.
Pubblicazione: (2024)
A More General Linear Projectile Problem
di: Lorenzo, Nick
Pubblicazione: (2024)
di: Lorenzo, Nick
Pubblicazione: (2024)
Attention Debiasing for Token Pruning in Vision Language Models
di: Zhao, Kai, et al.
Pubblicazione: (2025)
di: Zhao, Kai, et al.
Pubblicazione: (2025)
One Token Embedding Is Enough to Deadlock Your Large Reasoning Model
di: Zhang, Mohan, et al.
Pubblicazione: (2025)
di: Zhang, Mohan, et al.
Pubblicazione: (2025)
Workload Distribution with Rateless Encoding: A Low-Latency Computation Offloading Method within Edge Networks
di: Guo, Zhongfu, et al.
Pubblicazione: (2023)
di: Guo, Zhongfu, et al.
Pubblicazione: (2023)
Finding Transformer Circuits with Edge Pruning
di: Bhaskar, Adithya, et al.
Pubblicazione: (2024)
di: Bhaskar, Adithya, et al.
Pubblicazione: (2024)
HEART-VIT: Hessian-Guided Efficient Dynamic Attention and Token Pruning in Vision Transformer
di: Uddin, Mohammad Helal, et al.
Pubblicazione: (2025)
di: Uddin, Mohammad Helal, et al.
Pubblicazione: (2025)
Zero-TPrune: Zero-Shot Token Pruning through Leveraging of the Attention Graph in Pre-Trained Transformers
di: Wang, Hongjie, et al.
Pubblicazione: (2023)
di: Wang, Hongjie, et al.
Pubblicazione: (2023)
SATA: Spatial Autocorrelation Token Analysis for Enhancing the Robustness of Vision Transformers
di: Nikzad, Nick, et al.
Pubblicazione: (2024)
di: Nikzad, Nick, et al.
Pubblicazione: (2024)
Object-Centric Vision Token Pruning for Vision Language Models
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
TP-Spikformer: Token Pruned Spiking Transformer
di: Wei, Wenjie, et al.
Pubblicazione: (2026)
di: Wei, Wenjie, et al.
Pubblicazione: (2026)
Token Pruning for In-Context Generation in Diffusion Transformers
di: Lin, Junqing, et al.
Pubblicazione: (2026)
di: Lin, Junqing, et al.
Pubblicazione: (2026)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
di: Li, Ao, et al.
Pubblicazione: (2025)
di: Li, Ao, et al.
Pubblicazione: (2025)
IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning
di: Sun, Zhichao, et al.
Pubblicazione: (2026)
di: Sun, Zhichao, et al.
Pubblicazione: (2026)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
di: Liu, Jizhihui, et al.
Pubblicazione: (2025)
di: Liu, Jizhihui, et al.
Pubblicazione: (2025)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
di: Lee, Dong-Jae, et al.
Pubblicazione: (2026)
di: Lee, Dong-Jae, et al.
Pubblicazione: (2026)
Affinity Is Not Enough: Recovering the Free Energy Principle in Mixture-of-Experts
di: Wong, Man Yung
Pubblicazione: (2026)
di: Wong, Man Yung
Pubblicazione: (2026)
Less is More: Optimizing Probe Selection Using Shared Latency Anomalies
di: Sharma, Taveesh, et al.
Pubblicazione: (2026)
di: Sharma, Taveesh, et al.
Pubblicazione: (2026)
Exploring Token Pruning in Vision State Space Models
di: Zhan, Zheng, et al.
Pubblicazione: (2024)
di: Zhan, Zheng, et al.
Pubblicazione: (2024)
HQP: Sensitivity-Aware Hybrid Quantization and Pruning for Ultra-Low-Latency Edge AI Inference
di: Gopalan, Dinesh, et al.
Pubblicazione: (2026)
di: Gopalan, Dinesh, et al.
Pubblicazione: (2026)
Can Large-Language Models Help us Better Understand and Teach the Development of Energy-Efficient Software?
di: Hasler, Ryan, et al.
Pubblicazione: (2024)
di: Hasler, Ryan, et al.
Pubblicazione: (2024)
PolyLUT: Ultra-low Latency Polynomial Inference with Hardware-Aware Structured Pruning
di: Andronic, Marta, et al.
Pubblicazione: (2025)
di: Andronic, Marta, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Token Turing Machines are Efficient Vision Models
di: Jajal, Purvish, et al.
Pubblicazione: (2024) -
AdaPerceiver: Transformers with Adaptive Width, Depth, and Tokens
di: Jajal, Purvish, et al.
Pubblicazione: (2025) -
Inference-Time Alignment of Diffusion Models via Evolutionary Algorithms
di: Jajal, Purvish, et al.
Pubblicazione: (2025) -
LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection
di: Chou, Benjamin Shiue-Hal, et al.
Pubblicazione: (2025) -
Detecting Music Performance Errors with Transformers
di: Chou, Benjamin Shiue-Hal, et al.
Pubblicazione: (2025)