HarmoniCa: Harmonizing Training and Inference for Better Feature Caching in Diffusion Transformer Acceleration
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Yushi, Wang, Zining, Gong, Ruihao, Liu, Jing, Zhang, Xinjie, Guo, Jinyang, Liu, Xianglong, Zhang, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping
por: Huang, Yushi, et al.
Publicado: (2025)
por: Huang, Yushi, et al.
Publicado: (2025)
PTSBench: A Comprehensive Post-Training Sparsity Benchmark Towards Algorithms and Models
por: Wnag, Zining, et al.
Publicado: (2024)
por: Wnag, Zining, et al.
Publicado: (2024)
TFMQ-DM: Temporal Feature Maintenance Quantization for Diffusion Models
por: Huang, Yushi, et al.
Publicado: (2023)
por: Huang, Yushi, et al.
Publicado: (2023)
Temporal Feature Matters: A Framework for Diffusion Model Quantization
por: Huang, Yushi, et al.
Publicado: (2024)
por: Huang, Yushi, et al.
Publicado: (2024)
SpeCa: Accelerating Diffusion Transformers with Speculative Feature Caching
por: Liu, Jiacheng, et al.
Publicado: (2025)
por: Liu, Jiacheng, et al.
Publicado: (2025)
Fast and Controllable Post-training Sparsity: Learning Optimal Sparsity Allocation with Global Constraint in Minutes
por: Gong, Ruihao, et al.
Publicado: (2024)
por: Gong, Ruihao, et al.
Publicado: (2024)
Accelerating Diffusion Transformers with Token-wise Feature Caching
por: Zou, Chang, et al.
Publicado: (2024)
por: Zou, Chang, et al.
Publicado: (2024)
Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
por: Long, Lingkun, et al.
Publicado: (2026)
por: Long, Lingkun, et al.
Publicado: (2026)
DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching
por: Zou, Chang, et al.
Publicado: (2026)
por: Zou, Chang, et al.
Publicado: (2026)
Collaborative Few-Step Distillation and Low-Bit Quantization for Wan2.2 Dual-Expert Video Diffusion Models
por: Du, Jinyang, et al.
Publicado: (2026)
por: Du, Jinyang, et al.
Publicado: (2026)
Rethinking Token-wise Feature Caching: Accelerating Diffusion Transformers with Dual Feature Caching
por: Zou, Chang, et al.
Publicado: (2024)
por: Zou, Chang, et al.
Publicado: (2024)
A Survey of Low-bit Large Language Models: Basics, Systems, and Algorithms
por: Gong, Ruihao, et al.
Publicado: (2024)
por: Gong, Ruihao, et al.
Publicado: (2024)
LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation
por: Huang, Yushi, et al.
Publicado: (2025)
por: Huang, Yushi, et al.
Publicado: (2025)
SmoothCache: A Universal Inference Acceleration Technique for Diffusion Transformers
por: Liu, Joseph, et al.
Publicado: (2024)
por: Liu, Joseph, et al.
Publicado: (2024)
SGMD: Score Gradient Matching Distillation for Few-Step Video Diffusion Distillation
por: Wu, Zhuguanyu, et al.
Publicado: (2026)
por: Wu, Zhuguanyu, et al.
Publicado: (2026)
Light Forcing: Accelerating Autoregressive Video Diffusion via Sparse Attention
por: Lv, Chengtao, et al.
Publicado: (2026)
por: Lv, Chengtao, et al.
Publicado: (2026)
AB-Cache: Training-Free Acceleration of Diffusion Models via Adams-Bashforth Cached Feature Reuse
por: Yu, Zichao, et al.
Publicado: (2025)
por: Yu, Zichao, et al.
Publicado: (2025)
Relational Feature Caching for Accelerating Diffusion Transformers
por: Son, Byunggwan, et al.
Publicado: (2026)
por: Son, Byunggwan, et al.
Publicado: (2026)
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
por: Gong, Ruihao, et al.
Publicado: (2024)
por: Gong, Ruihao, et al.
Publicado: (2024)
QVGen: Pushing the Limit of Quantized Video Generative Models
por: Huang, Yushi, et al.
Publicado: (2025)
por: Huang, Yushi, et al.
Publicado: (2025)
Beyond Few-Step Inference: Accelerating Video Diffusion Transformer Model Serving with Inter-Request Caching Reuse
por: Liu, Hao, et al.
Publicado: (2026)
por: Liu, Hao, et al.
Publicado: (2026)
FreqCa: Accelerating Diffusion Models via Frequency-Aware Caching
por: Liu, Jiacheng, et al.
Publicado: (2025)
por: Liu, Jiacheng, et al.
Publicado: (2025)
Token Caching for Diffusion Transformer Acceleration
por: Lou, Jinming, et al.
Publicado: (2024)
por: Lou, Jinming, et al.
Publicado: (2024)
Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?
por: Sun, Lingchen, et al.
Publicado: (2026)
por: Sun, Lingchen, et al.
Publicado: (2026)
ProCache: Constraint-Aware Feature Caching with Selective Computation for Diffusion Transformer Acceleration
por: Cao, Fanpu, et al.
Publicado: (2025)
por: Cao, Fanpu, et al.
Publicado: (2025)
U-Harmony: Enhancing Joint Training for Segmentation Models with Universal Harmonization
por: Ma, Weiwei, et al.
Publicado: (2026)
por: Ma, Weiwei, et al.
Publicado: (2026)
HarmoniDiff-RS: Training-Free Diffusion Harmonization for Satellite Image Composition
por: Zhuang, Xiaoqi, et al.
Publicado: (2026)
por: Zhuang, Xiaoqi, et al.
Publicado: (2026)
Token Pruning for Caching Better: 9 Times Acceleration on Stable Diffusion for Free
por: Zhang, Evelyn, et al.
Publicado: (2024)
por: Zhang, Evelyn, et al.
Publicado: (2024)
PTQ4SAM: Post-Training Quantization for Segment Anything
por: Lv, Chengtao, et al.
Publicado: (2024)
por: Lv, Chengtao, et al.
Publicado: (2024)
BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design
por: Ding, Yifu, et al.
Publicado: (2026)
por: Ding, Yifu, et al.
Publicado: (2026)
Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation
por: Ge, Xingtong, et al.
Publicado: (2026)
por: Ge, Xingtong, et al.
Publicado: (2026)
Accelerating Diffusion Transformer via Gradient-Optimized Cache
por: Qiu, Junxiang, et al.
Publicado: (2025)
por: Qiu, Junxiang, et al.
Publicado: (2025)
Accelerating Diffusion Transformer via Error-Optimized Cache
por: Qiu, Junxiang, et al.
Publicado: (2025)
por: Qiu, Junxiang, et al.
Publicado: (2025)
Let Features Decide Their Own Solvers: Hybrid Feature Caching for Diffusion Transformers
por: Zheng, Shikang, et al.
Publicado: (2025)
por: Zheng, Shikang, et al.
Publicado: (2025)
Exploiting Defenses against GAN-Based Feature Inference Attacks in Federated Learning
por: Luo, Xinjian, et al.
Publicado: (2020)
por: Luo, Xinjian, et al.
Publicado: (2020)
Forecast then Calibrate: Feature Caching as ODE for Efficient Diffusion Transformers
por: Zheng, Shikang, et al.
Publicado: (2025)
por: Zheng, Shikang, et al.
Publicado: (2025)
Compute Only 16 Tokens in One Timestep: Accelerating Diffusion Transformers with Cluster-Driven Feature Caching
por: Zheng, Zhixin, et al.
Publicado: (2025)
por: Zheng, Zhixin, et al.
Publicado: (2025)
Learning-to-Cache: Accelerating Diffusion Transformer via Layer Caching
por: Ma, Xinyin, et al.
Publicado: (2024)
por: Ma, Xinyin, et al.
Publicado: (2024)
LLMC+: Benchmarking Vision-Language Model Compression with a Plug-and-play Toolkit
por: Lv, Chengtao, et al.
Publicado: (2025)
por: Lv, Chengtao, et al.
Publicado: (2025)
Window-Diffusion: Accelerating Diffusion Language Model Inference with Windowed Token Pruning and Caching
por: Zuo, Fengrui, et al.
Publicado: (2026)
por: Zuo, Fengrui, et al.
Publicado: (2026)
Ejemplares similares
-
MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping
por: Huang, Yushi, et al.
Publicado: (2025) -
PTSBench: A Comprehensive Post-Training Sparsity Benchmark Towards Algorithms and Models
por: Wnag, Zining, et al.
Publicado: (2024) -
TFMQ-DM: Temporal Feature Maintenance Quantization for Diffusion Models
por: Huang, Yushi, et al.
Publicado: (2023) -
Temporal Feature Matters: A Framework for Diffusion Model Quantization
por: Huang, Yushi, et al.
Publicado: (2024) -
SpeCa: Accelerating Diffusion Transformers with Speculative Feature Caching
por: Liu, Jiacheng, et al.
Publicado: (2025)