MixDQ: Memory-Efficient Few-Step Text-to-Image Diffusion Models with Metric-Decoupled Mixed Precision Quantization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Tianchen, Ning, Xuefei, Fang, Tongcheng, Liu, Enshu, Huang, Guyue, Lin, Zinan, Yan, Shengen, Dai, Guohao, Wang, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ViDiT-Q: Efficient and Accurate Quantization of Diffusion Transformers for Image and Video Generation
par: Zhao, Tianchen, et autres
Publié: (2024)
par: Zhao, Tianchen, et autres
Publié: (2024)
Distilled Decoding 2: One-step Sampling of Image Auto-regressive Models with Conditional Score Distillation
par: Liu, Enshu, et autres
Publié: (2025)
par: Liu, Enshu, et autres
Publié: (2025)
Efficient Expert Pruning for Sparse Mixture-of-Experts Language Models: Enhancing Performance and Reducing Inference Costs
par: Liu, Enshu, et autres
Publié: (2024)
par: Liu, Enshu, et autres
Publié: (2024)
FlashEval: Towards Fast and Accurate Evaluation of Text-to-image Diffusion Generative Models
par: Zhao, Lin, et autres
Publié: (2024)
par: Zhao, Lin, et autres
Publié: (2024)
NI Sampling: Accelerating Discrete Diffusion Sampling by Token Order Optimization
par: Liu, Enshu, et autres
Publié: (2026)
par: Liu, Enshu, et autres
Publié: (2026)
Distilled Decoding 1: One-step Sampling of Image Auto-regressive Models with Flow Matching
par: Liu, Enshu, et autres
Publié: (2024)
par: Liu, Enshu, et autres
Publié: (2024)
Linear Combination of Saved Checkpoints Makes Consistency and Diffusion Models Better
par: Liu, Enshu, et autres
Publié: (2024)
par: Liu, Enshu, et autres
Publié: (2024)
PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs
par: Liu, Tengxuan, et autres
Publié: (2025)
par: Liu, Tengxuan, et autres
Publié: (2025)
DiTFastAttn: Attention Compression for Diffusion Transformer Models
par: Yuan, Zhihang, et autres
Publié: (2024)
par: Yuan, Zhihang, et autres
Publié: (2024)
E-CAR: Efficient Continuous Autoregressive Image Generation via Multistage Modeling
par: Yuan, Zhihang, et autres
Publié: (2024)
par: Yuan, Zhihang, et autres
Publié: (2024)
Evaluating Quantized Large Language Models
par: Li, Shiyao, et autres
Publié: (2024)
par: Li, Shiyao, et autres
Publié: (2024)
CSKV: Training-Efficient Channel Shrinking for KV Cache in Long-Context Scenarios
par: Wang, Luning, et autres
Publié: (2024)
par: Wang, Luning, et autres
Publié: (2024)
Latent Zoning Network: A Unified Principle for Generative Modeling, Representation Learning, and Classification
par: Lin, Zinan, et autres
Publié: (2025)
par: Lin, Zinan, et autres
Publié: (2025)
MixDiT: Accelerating Image Diffusion Transformer Inference with Mixed-Precision MX Quantization
par: Kim, Daeun, et autres
Publié: (2025)
par: Kim, Daeun, et autres
Publié: (2025)
R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing
par: Fu, Tianyu, et autres
Publié: (2025)
par: Fu, Tianyu, et autres
Publié: (2025)
DLFR-VAE: Dynamic Latent Frame Rate VAE for Video Generation
par: Yuan, Zhihang, et autres
Publié: (2025)
par: Yuan, Zhihang, et autres
Publié: (2025)
SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer
par: Fang, Tongcheng, et autres
Publié: (2026)
par: Fang, Tongcheng, et autres
Publié: (2026)
TR-DQ: Time-Rotation Diffusion Quantization
par: Shao, Yihua, et autres
Publié: (2025)
par: Shao, Yihua, et autres
Publié: (2025)
MPQ-Diff: Mixed Precision Quantization for Diffusion Models
par: Maruzzelli, Rocco Manz, et autres
Publié: (2024)
par: Maruzzelli, Rocco Manz, et autres
Publié: (2024)
DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition
par: Shao, Qijie, et autres
Publié: (2025)
par: Shao, Qijie, et autres
Publié: (2025)
Efficient Mixed Precision Quantization in Graph Neural Networks
par: Moustafa, Samir, et autres
Publié: (2025)
par: Moustafa, Samir, et autres
Publié: (2025)
Flexible Mixed Precision Quantization for Learned Image Compression
par: Hossain, Md Adnan Faisal, et autres
Publié: (2025)
par: Hossain, Md Adnan Faisal, et autres
Publié: (2025)
DiM: Diffusion Mamba for Efficient High-Resolution Image Synthesis
par: Teng, Yao, et autres
Publié: (2024)
par: Teng, Yao, et autres
Publié: (2024)
MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models
par: Liu, Wenyuan, et autres
Publié: (2025)
par: Liu, Wenyuan, et autres
Publié: (2025)
BitSnap: Checkpoint Sparsification and Quantization in LLM Training
par: Peng, Yanxin, et autres
Publié: (2025)
par: Peng, Yanxin, et autres
Publié: (2025)
Mix-QSAM: Mixed-Precision Quantization of the Segment Anything Model
par: Ranjan, Navin, et autres
Publié: (2025)
par: Ranjan, Navin, et autres
Publié: (2025)
Effective and Efficient Mixed Precision Quantization of Speech Foundation Models
par: Xu, Haoning, et autres
Publié: (2025)
par: Xu, Haoning, et autres
Publié: (2025)
OMPQ: Orthogonal Mixed Precision Quantization
par: Ma, Yuexiao, et autres
Publié: (2021)
par: Ma, Yuexiao, et autres
Publié: (2021)
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models
par: Fu, Tianyu, et autres
Publié: (2024)
par: Fu, Tianyu, et autres
Publié: (2024)
Mix-Quant: Quantized Prefilling, Precise Decoding for Agentic LLMs
par: Lu, Haiquan, et autres
Publié: (2026)
par: Lu, Haiquan, et autres
Publié: (2026)
Sensitivity-Aware Mixed-Precision Quantization for ReRAM-based Computing-in-Memory
par: Chen, Guan-Cheng, et autres
Publié: (2025)
par: Chen, Guan-Cheng, et autres
Publié: (2025)
MBQ: Modality-Balanced Quantization for Large Vision-Language Models
par: Li, Shiyao, et autres
Publié: (2024)
par: Li, Shiyao, et autres
Publié: (2024)
Mix-QViT: Mixed-Precision Vision Transformer Quantization Driven by Layer Importance and Quantization Sensitivity
par: Ranjan, Navin, et autres
Publié: (2025)
par: Ranjan, Navin, et autres
Publié: (2025)
6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models
par: Su, Rundong, et autres
Publié: (2026)
par: Su, Rundong, et autres
Publié: (2026)
DynaQuant: Dynamic Mixed-Precision Quantization for Learned Image Compression
par: Bao, Youneng, et autres
Publié: (2025)
par: Bao, Youneng, et autres
Publié: (2025)
MPQ-DM: Mixed Precision Quantization for Extremely Low Bit Diffusion Models
par: Feng, Weilun, et autres
Publié: (2024)
par: Feng, Weilun, et autres
Publié: (2024)
MetaMix: Meta-state Precision Searcher for Mixed-precision Activation Quantization
par: Kim, Han-Byul, et autres
Publié: (2023)
par: Kim, Han-Byul, et autres
Publié: (2023)
RAMP: Reinforcement Adaptive Mixed Precision Quantization for Efficient On Device LLM Inference
par: Gautam, Arpit Singh, et autres
Publié: (2026)
par: Gautam, Arpit Singh, et autres
Publié: (2026)
DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition
par: Shao, Hang, et autres
Publié: (2023)
par: Shao, Hang, et autres
Publié: (2023)
LiteVAR: Compressing Visual Autoregressive Modelling with Efficient Attention and Quantization
par: Xie, Rui, et autres
Publié: (2024)
par: Xie, Rui, et autres
Publié: (2024)
Documents similaires
-
ViDiT-Q: Efficient and Accurate Quantization of Diffusion Transformers for Image and Video Generation
par: Zhao, Tianchen, et autres
Publié: (2024) -
Distilled Decoding 2: One-step Sampling of Image Auto-regressive Models with Conditional Score Distillation
par: Liu, Enshu, et autres
Publié: (2025) -
Efficient Expert Pruning for Sparse Mixture-of-Experts Language Models: Enhancing Performance and Reducing Inference Costs
par: Liu, Enshu, et autres
Publié: (2024) -
FlashEval: Towards Fast and Accurate Evaluation of Text-to-image Diffusion Generative Models
par: Zhao, Lin, et autres
Publié: (2024) -
NI Sampling: Accelerating Discrete Diffusion Sampling by Token Order Optimization
par: Liu, Enshu, et autres
Publié: (2026)