ViDiT-Q: Efficient and Accurate Quantization of Diffusion Transformers for Image and Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Tianchen, Fang, Tongcheng, Huang, Haofeng, Liu, Enshu, Wan, Rui, Soedarmadji, Widyadewi, Li, Shiyao, Lin, Zinan, Dai, Guohao, Yan, Shengen, Yang, Huazhong, Ning, Xuefei, Wang, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MixDQ: Memory-Efficient Few-Step Text-to-Image Diffusion Models with Metric-Decoupled Mixed Precision Quantization
di: Zhao, Tianchen, et al.
Pubblicazione: (2024)
di: Zhao, Tianchen, et al.
Pubblicazione: (2024)
FlashEval: Towards Fast and Accurate Evaluation of Text-to-image Diffusion Generative Models
di: Zhao, Lin, et al.
Pubblicazione: (2024)
di: Zhao, Lin, et al.
Pubblicazione: (2024)
Distilled Decoding 2: One-step Sampling of Image Auto-regressive Models with Conditional Score Distillation
di: Liu, Enshu, et al.
Pubblicazione: (2025)
di: Liu, Enshu, et al.
Pubblicazione: (2025)
Efficient Expert Pruning for Sparse Mixture-of-Experts Language Models: Enhancing Performance and Reducing Inference Costs
di: Liu, Enshu, et al.
Pubblicazione: (2024)
di: Liu, Enshu, et al.
Pubblicazione: (2024)
DiTFastAttn: Attention Compression for Diffusion Transformer Models
di: Yuan, Zhihang, et al.
Pubblicazione: (2024)
di: Yuan, Zhihang, et al.
Pubblicazione: (2024)
Evaluating Quantized Large Language Models
di: Li, Shiyao, et al.
Pubblicazione: (2024)
di: Li, Shiyao, et al.
Pubblicazione: (2024)
Linear Combination of Saved Checkpoints Makes Consistency and Diffusion Models Better
di: Liu, Enshu, et al.
Pubblicazione: (2024)
di: Liu, Enshu, et al.
Pubblicazione: (2024)
NI Sampling: Accelerating Discrete Diffusion Sampling by Token Order Optimization
di: Liu, Enshu, et al.
Pubblicazione: (2026)
di: Liu, Enshu, et al.
Pubblicazione: (2026)
PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs
di: Liu, Tengxuan, et al.
Pubblicazione: (2025)
di: Liu, Tengxuan, et al.
Pubblicazione: (2025)
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models
di: Fu, Tianyu, et al.
Pubblicazione: (2024)
di: Fu, Tianyu, et al.
Pubblicazione: (2024)
Distilled Decoding 1: One-step Sampling of Image Auto-regressive Models with Flow Matching
di: Liu, Enshu, et al.
Pubblicazione: (2024)
di: Liu, Enshu, et al.
Pubblicazione: (2024)
MBQ: Modality-Balanced Quantization for Large Vision-Language Models
di: Li, Shiyao, et al.
Pubblicazione: (2024)
di: Li, Shiyao, et al.
Pubblicazione: (2024)
CSKV: Training-Efficient Channel Shrinking for KV Cache in Long-Context Scenarios
di: Wang, Luning, et al.
Pubblicazione: (2024)
di: Wang, Luning, et al.
Pubblicazione: (2024)
Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers
di: Chen, Lei, et al.
Pubblicazione: (2024)
di: Chen, Lei, et al.
Pubblicazione: (2024)
Mixture of Attention Spans: Optimizing LLM Inference Efficiency with Heterogeneous Sliding-Window Lengths
di: Fu, Tianyu, et al.
Pubblicazione: (2024)
di: Fu, Tianyu, et al.
Pubblicazione: (2024)
R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing
di: Fu, Tianyu, et al.
Pubblicazione: (2025)
di: Fu, Tianyu, et al.
Pubblicazione: (2025)
Can LLMs Learn by Teaching for Better Reasoning? A Preliminary Study
di: Ning, Xuefei, et al.
Pubblicazione: (2024)
di: Ning, Xuefei, et al.
Pubblicazione: (2024)
SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer
di: Fang, Tongcheng, et al.
Pubblicazione: (2026)
di: Fang, Tongcheng, et al.
Pubblicazione: (2026)
DLFR-VAE: Dynamic Latent Frame Rate VAE for Video Generation
di: Yuan, Zhihang, et al.
Pubblicazione: (2025)
di: Yuan, Zhihang, et al.
Pubblicazione: (2025)
Latent Zoning Network: A Unified Principle for Generative Modeling, Representation Learning, and Classification
di: Lin, Zinan, et al.
Pubblicazione: (2025)
di: Lin, Zinan, et al.
Pubblicazione: (2025)
DiTFastAttnV2: Head-wise Attention Compression for Multi-Modality Diffusion Transformers
di: Zhang, Hanling, et al.
Pubblicazione: (2025)
di: Zhang, Hanling, et al.
Pubblicazione: (2025)
LRQ-DiT: Log-Rotation Post-Training Quantization of Diffusion Transformers for Image and Video Generation
di: Yang, Lianwei, et al.
Pubblicazione: (2025)
di: Yang, Lianwei, et al.
Pubblicazione: (2025)
Q-VDiT: Towards Accurate Quantization and Distillation of Video-Generation Diffusion Transformers
di: Feng, Weilun, et al.
Pubblicazione: (2025)
di: Feng, Weilun, et al.
Pubblicazione: (2025)
TaQ-DiT: Time-aware Quantization for Diffusion Transformers
di: Liu, Xinyan, et al.
Pubblicazione: (2024)
di: Liu, Xinyan, et al.
Pubblicazione: (2024)
DiM: Diffusion Mamba for Efficient High-Resolution Image Synthesis
di: Teng, Yao, et al.
Pubblicazione: (2024)
di: Teng, Yao, et al.
Pubblicazione: (2024)
VGDFR: Diffusion-based Video Generation with Dynamic Latent Frame Rate
di: Yuan, Zhihang, et al.
Pubblicazione: (2025)
di: Yuan, Zhihang, et al.
Pubblicazione: (2025)
Skeleton-of-Thought: Prompting LLMs for Efficient Parallel Generation
di: Ning, Xuefei, et al.
Pubblicazione: (2023)
di: Ning, Xuefei, et al.
Pubblicazione: (2023)
LiteVAR: Compressing Visual Autoregressive Modelling with Efficient Attention and Quantization
di: Xie, Rui, et al.
Pubblicazione: (2024)
di: Xie, Rui, et al.
Pubblicazione: (2024)
E-CAR: Efficient Continuous Autoregressive Image Generation via Multistage Modeling
di: Yuan, Zhihang, et al.
Pubblicazione: (2024)
di: Yuan, Zhihang, et al.
Pubblicazione: (2024)
DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers
di: Sharify, Sayeh, et al.
Pubblicazione: (2026)
di: Sharify, Sayeh, et al.
Pubblicazione: (2026)
BitSnap: Checkpoint Sparsification and Quantization in LLM Training
di: Peng, Yanxin, et al.
Pubblicazione: (2025)
di: Peng, Yanxin, et al.
Pubblicazione: (2025)
S$^2$Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation
di: Feng, Weilun, et al.
Pubblicazione: (2025)
di: Feng, Weilun, et al.
Pubblicazione: (2025)
Q-BERT4Rec: Quantized Semantic-ID Representation Learning for Multimodal Recommendation
di: Huang, Haofeng, et al.
Pubblicazione: (2025)
di: Huang, Haofeng, et al.
Pubblicazione: (2025)
LV-Eval: A Balanced Long-Context Benchmark with 5 Length Levels Up to 256K
di: Yuan, Tao, et al.
Pubblicazione: (2024)
di: Yuan, Tao, et al.
Pubblicazione: (2024)
DiViD: Disentangled Video Diffusion for Static-Dynamic Factorization
di: Gheisari, Marzieh, et al.
Pubblicazione: (2025)
di: Gheisari, Marzieh, et al.
Pubblicazione: (2025)
Characterizing and Optimizing Real-Time Optimal Control for Embedded SoCs
di: Dong, Kris Shengjun, et al.
Pubblicazione: (2024)
di: Dong, Kris Shengjun, et al.
Pubblicazione: (2024)
Virtual Personas for Language Models via an Anthology of Backstories
di: Moon, Suhong, et al.
Pubblicazione: (2024)
di: Moon, Suhong, et al.
Pubblicazione: (2024)
ViDiC: Video Difference Captioning
di: Wu, Jiangtao, et al.
Pubblicazione: (2025)
di: Wu, Jiangtao, et al.
Pubblicazione: (2025)
TQ-DiT: Efficient Time-Aware Quantization for Diffusion Transformers
di: Hwang, Younghye, et al.
Pubblicazione: (2025)
di: Hwang, Younghye, et al.
Pubblicazione: (2025)
PTQ4DiT: Post-training Quantization for Diffusion Transformers
di: Wu, Junyi, et al.
Pubblicazione: (2024)
di: Wu, Junyi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MixDQ: Memory-Efficient Few-Step Text-to-Image Diffusion Models with Metric-Decoupled Mixed Precision Quantization
di: Zhao, Tianchen, et al.
Pubblicazione: (2024) -
FlashEval: Towards Fast and Accurate Evaluation of Text-to-image Diffusion Generative Models
di: Zhao, Lin, et al.
Pubblicazione: (2024) -
Distilled Decoding 2: One-step Sampling of Image Auto-regressive Models with Conditional Score Distillation
di: Liu, Enshu, et al.
Pubblicazione: (2025) -
Efficient Expert Pruning for Sparse Mixture-of-Experts Language Models: Enhancing Performance and Reducing Inference Costs
di: Liu, Enshu, et al.
Pubblicazione: (2024) -
DiTFastAttn: Attention Compression for Diffusion Transformer Models
di: Yuan, Zhihang, et al.
Pubblicazione: (2024)