Token Pruning for Caching Better: 9 Times Acceleration on Stable Diffusion for Free
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Evelyn, Xiao, Bang, Tang, Jiayi, Ma, Qianli, Zou, Chang, Ning, Xuefei, Hu, Xuming, Zhang, Linfeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Rethinking Token-wise Feature Caching: Accelerating Diffusion Transformers with Dual Feature Caching
di: Zou, Chang, et al.
Pubblicazione: (2024)
di: Zou, Chang, et al.
Pubblicazione: (2024)
Accelerating Diffusion Transformers with Token-wise Feature Caching
di: Zou, Chang, et al.
Pubblicazione: (2024)
di: Zou, Chang, et al.
Pubblicazione: (2024)
Compute Only 16 Tokens in One Timestep: Accelerating Diffusion Transformers with Cluster-Driven Feature Caching
di: Zheng, Zhixin, et al.
Pubblicazione: (2025)
di: Zheng, Zhixin, et al.
Pubblicazione: (2025)
Decouple-Then-Merge: Finetune Diffusion Models as Multi-Task Learning
di: Ma, Qianli, et al.
Pubblicazione: (2024)
di: Ma, Qianli, et al.
Pubblicazione: (2024)
LazyMAR: Accelerating Masked Autoregressive Models via Feature Caching
di: Yan, Feihong, et al.
Pubblicazione: (2025)
di: Yan, Feihong, et al.
Pubblicazione: (2025)
dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching
di: Liu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Liu, Zhiyuan, et al.
Pubblicazione: (2025)
SpeCa: Accelerating Diffusion Transformers with Speculative Feature Caching
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
Token Caching for Diffusion Transformer Acceleration
di: Lou, Jinming, et al.
Pubblicazione: (2024)
di: Lou, Jinming, et al.
Pubblicazione: (2024)
Window-Diffusion: Accelerating Diffusion Language Model Inference with Windowed Token Pruning and Caching
di: Zuo, Fengrui, et al.
Pubblicazione: (2026)
di: Zuo, Fengrui, et al.
Pubblicazione: (2026)
HiCache: A Plug-in Scaled-Hermite Upgrade for Taylor-Style Cache-then-Forecast Diffusion Acceleration
di: Feng, Liang, et al.
Pubblicazione: (2025)
di: Feng, Liang, et al.
Pubblicazione: (2025)
DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching
di: Zou, Chang, et al.
Pubblicazione: (2026)
di: Zou, Chang, et al.
Pubblicazione: (2026)
FreqCa: Accelerating Diffusion Models via Frequency-Aware Caching
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
NI Sampling: Accelerating Discrete Diffusion Sampling by Token Order Optimization
di: Liu, Enshu, et al.
Pubblicazione: (2026)
di: Liu, Enshu, et al.
Pubblicazione: (2026)
AB-Cache: Training-Free Acceleration of Diffusion Models via Adams-Bashforth Cached Feature Reuse
di: Yu, Zichao, et al.
Pubblicazione: (2025)
di: Yu, Zichao, et al.
Pubblicazione: (2025)
Accelerating Diffusion Models with One-to-Many Knowledge Distillation
di: Zhang, Linfeng, et al.
Pubblicazione: (2024)
di: Zhang, Linfeng, et al.
Pubblicazione: (2024)
D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning
di: Zhang, Evelyn, et al.
Pubblicazione: (2025)
di: Zhang, Evelyn, et al.
Pubblicazione: (2025)
From Reusing to Forecasting: Accelerating Diffusion Models with TaylorSeers
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM Reasoning
di: Qin, Jialong, et al.
Pubblicazione: (2025)
di: Qin, Jialong, et al.
Pubblicazione: (2025)
WorldCache: Accelerating World Models for Free via Heterogeneous Token Caching
di: Feng, Weilun, et al.
Pubblicazione: (2026)
di: Feng, Weilun, et al.
Pubblicazione: (2026)
HarmoniCa: Harmonizing Training and Inference for Better Feature Caching in Diffusion Transformer Acceleration
di: Huang, Yushi, et al.
Pubblicazione: (2024)
di: Huang, Yushi, et al.
Pubblicazione: (2024)
Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention
di: Zou, Xin, et al.
Pubblicazione: (2025)
di: Zou, Xin, et al.
Pubblicazione: (2025)
Forecast then Calibrate: Feature Caching as ODE for Efficient Diffusion Transformers
di: Zheng, Shikang, et al.
Pubblicazione: (2025)
di: Zheng, Shikang, et al.
Pubblicazione: (2025)
Neural-Symbolic Message Passing with Dynamic Pruning
di: Zhang, Chongzhi, et al.
Pubblicazione: (2025)
di: Zhang, Chongzhi, et al.
Pubblicazione: (2025)
Efficient Sparse-to-Dense Visual Localization via Compact Gaussian Scene Representation and Accelerated Dense Pose Estimation
di: Li, Zizhuo, et al.
Pubblicazione: (2026)
di: Li, Zizhuo, et al.
Pubblicazione: (2026)
Let Features Decide Their Own Solvers: Hybrid Feature Caching for Diffusion Transformers
di: Zheng, Shikang, et al.
Pubblicazione: (2025)
di: Zheng, Shikang, et al.
Pubblicazione: (2025)
FreqCache: Accelerating Embodied VLN Models with Adaptive Frequency-Guided Token Caching
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
di: Yang, Yantai, et al.
Pubblicazione: (2025)
di: Yang, Yantai, et al.
Pubblicazione: (2025)
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
Learning-to-Cache: Accelerating Diffusion Transformer via Layer Caching
di: Ma, Xinyin, et al.
Pubblicazione: (2024)
di: Ma, Xinyin, et al.
Pubblicazione: (2024)
FastVAR: Linear Visual Autoregressive Modeling via Cached Token Pruning
di: Guo, Hang, et al.
Pubblicazione: (2025)
di: Guo, Hang, et al.
Pubblicazione: (2025)
CircuitSeer: Mining High-Quality Data by Probing Mathematical Reasoning Circuits in LLMs
di: Wang, Shaobo, et al.
Pubblicazione: (2025)
di: Wang, Shaobo, et al.
Pubblicazione: (2025)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
di: Wen, Zichen, et al.
Pubblicazione: (2025)
di: Wen, Zichen, et al.
Pubblicazione: (2025)
Towards Threshold-Free KV Cache Pruning
di: Ni, Xuanfan, et al.
Pubblicazione: (2025)
di: Ni, Xuanfan, et al.
Pubblicazione: (2025)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
di: Wang, Yuxuan, et al.
Pubblicazione: (2026)
di: Wang, Yuxuan, et al.
Pubblicazione: (2026)
Exploiting Deep Reinforcement Learning for Edge Caching in Cell-Free Massive MIMO Systems
di: Zhang, Yu, et al.
Pubblicazione: (2022)
di: Zhang, Yu, et al.
Pubblicazione: (2022)
Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM Inference
di: Huang, Jianuo, et al.
Pubblicazione: (2025)
di: Huang, Jianuo, et al.
Pubblicazione: (2025)
IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning
di: Sun, Zhichao, et al.
Pubblicazione: (2026)
di: Sun, Zhichao, et al.
Pubblicazione: (2026)
Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration
di: Wang, Shaoguang, et al.
Pubblicazione: (2025)
di: Wang, Shaoguang, et al.
Pubblicazione: (2025)
A Survey on Cache Methods in Diffusion Models: Toward Efficient Multi-Modal Generation
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
Forecast the Principal, Stabilize the Residual: Subspace-Aware Feature Caching for Efficient Diffusion Transformers
di: Chen, Guantao, et al.
Pubblicazione: (2026)
di: Chen, Guantao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Rethinking Token-wise Feature Caching: Accelerating Diffusion Transformers with Dual Feature Caching
di: Zou, Chang, et al.
Pubblicazione: (2024) -
Accelerating Diffusion Transformers with Token-wise Feature Caching
di: Zou, Chang, et al.
Pubblicazione: (2024) -
Compute Only 16 Tokens in One Timestep: Accelerating Diffusion Transformers with Cluster-Driven Feature Caching
di: Zheng, Zhixin, et al.
Pubblicazione: (2025) -
Decouple-Then-Merge: Finetune Diffusion Models as Multi-Task Learning
di: Ma, Qianli, et al.
Pubblicazione: (2024) -
LazyMAR: Accelerating Masked Autoregressive Models via Feature Caching
di: Yan, Feihong, et al.
Pubblicazione: (2025)