QuEPT: Quantized Elastic Precision Transformers with One-Shot Calibration for Multi-Bit Switching
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Ke, Wang, Yixin, Li, Zhongcheng, Cui, Hao, Hu, Jinshui, Zhang, Xingyi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MPQ-DM: Mixed Precision Quantization for Extremely Low Bit Diffusion Models
di: Feng, Weilun, et al.
Pubblicazione: (2024)
di: Feng, Weilun, et al.
Pubblicazione: (2024)
FLIQS: One-Shot Mixed-Precision Floating-Point and Integer Quantization Search
di: Dotzel, Jordan, et al.
Pubblicazione: (2023)
di: Dotzel, Jordan, et al.
Pubblicazione: (2023)
Quantization Variation: A New Perspective on Training Transformers with Low-Bit Precision
di: Huang, Xijie, et al.
Pubblicazione: (2023)
di: Huang, Xijie, et al.
Pubblicazione: (2023)
6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models
di: Su, Rundong, et al.
Pubblicazione: (2026)
di: Su, Rundong, et al.
Pubblicazione: (2026)
DeContext as Defense: Safe Image Editing in Diffusion Transformers
di: Shen, Linghui, et al.
Pubblicazione: (2025)
di: Shen, Linghui, et al.
Pubblicazione: (2025)
MPQ-DMv2: Flexible Residual Mixed Precision Quantization for Low-Bit Diffusion Models with Temporal Distillation
di: Feng, Weilun, et al.
Pubblicazione: (2025)
di: Feng, Weilun, et al.
Pubblicazione: (2025)
BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers
di: Xiao, Chaodong, et al.
Pubblicazione: (2026)
di: Xiao, Chaodong, et al.
Pubblicazione: (2026)
QuEST: Low-bit Diffusion Model Quantization via Efficient Selective Finetuning
di: Wang, Haoxuan, et al.
Pubblicazione: (2024)
di: Wang, Haoxuan, et al.
Pubblicazione: (2024)
BitsFusion: 1.99 bits Weight Quantization of Diffusion Model
di: Sui, Yang, et al.
Pubblicazione: (2024)
di: Sui, Yang, et al.
Pubblicazione: (2024)
Mix-QViT: Mixed-Precision Vision Transformer Quantization Driven by Layer Importance and Quantization Sensitivity
di: Ranjan, Navin, et al.
Pubblicazione: (2025)
di: Ranjan, Navin, et al.
Pubblicazione: (2025)
Retraining-free Model Quantization via One-Shot Weight-Coupling Learning
di: Tang, Chen, et al.
Pubblicazione: (2024)
di: Tang, Chen, et al.
Pubblicazione: (2024)
One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2026)
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2026)
SparseDFF: Sparse-View Feature Distillation for One-Shot Dexterous Manipulation
di: Wang, Qianxu, et al.
Pubblicazione: (2023)
di: Wang, Qianxu, et al.
Pubblicazione: (2023)
HQ-DM: Single Hadamard Transformation-Based Quantization-Aware Training for Low-Bit Diffusion Models
di: Mao, Shizhuo, et al.
Pubblicazione: (2025)
di: Mao, Shizhuo, et al.
Pubblicazione: (2025)
CalibQuant: 1-Bit KV Cache Quantization for Multimodal LLMs
di: Han, Insu, et al.
Pubblicazione: (2025)
di: Han, Insu, et al.
Pubblicazione: (2025)
MPTQ-ViT: Mixed-Precision Post-Training Quantization for Vision Transformer
di: Tai, Yu-Shan, et al.
Pubblicazione: (2024)
di: Tai, Yu-Shan, et al.
Pubblicazione: (2024)
MBQuant: A Novel Multi-Branch Topology Method for Arbitrary Bit-width Network Quantization
di: Zhong, Yunshan, et al.
Pubblicazione: (2023)
di: Zhong, Yunshan, et al.
Pubblicazione: (2023)
Nearly Lossless Adaptive Bit Switching
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
Q-ARVD: Quantizing Autoregressive Video Diffusion Models
di: Tang, Siao, et al.
Pubblicazione: (2026)
di: Tang, Siao, et al.
Pubblicazione: (2026)
Amortized-Precision Quantization for Early-Exit Vision Transformers
di: Fang, Rui, et al.
Pubblicazione: (2026)
di: Fang, Rui, et al.
Pubblicazione: (2026)
One-Shot Diffusion Mimicker for Handwritten Text Generation
di: Dai, Gang, et al.
Pubblicazione: (2024)
di: Dai, Gang, et al.
Pubblicazione: (2024)
BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary Codebook
di: Gu, Hao, et al.
Pubblicazione: (2025)
di: Gu, Hao, et al.
Pubblicazione: (2025)
Spatial-Temporal Multi-Scale Quantization for Flexible Motion Generation
di: Wang, Zan, et al.
Pubblicazione: (2025)
di: Wang, Zan, et al.
Pubblicazione: (2025)
Elastic Diffusion Transformer
di: Wang, Jiangshan, et al.
Pubblicazione: (2026)
di: Wang, Jiangshan, et al.
Pubblicazione: (2026)
Dissecting Bit-Level Scaling Laws in Quantizing Vision Generative Models
di: Ding, Xin, et al.
Pubblicazione: (2025)
di: Ding, Xin, et al.
Pubblicazione: (2025)
Progressive Fine-to-Coarse Reconstruction for Accurate Low-Bit Post-Training Quantization in Vision Transformers
di: Ding, Rui, et al.
Pubblicazione: (2024)
di: Ding, Rui, et al.
Pubblicazione: (2024)
LampQ: Towards Accurate Layer-wise Mixed Precision Quantization for Vision Transformers
di: Kim, Minjun, et al.
Pubblicazione: (2025)
di: Kim, Minjun, et al.
Pubblicazione: (2025)
MultiCo3D: Multi-Label Voxel Contrast for One-Shot Incremental Segmentation of 3D Neuroimages
di: Xu, Hao, et al.
Pubblicazione: (2025)
di: Xu, Hao, et al.
Pubblicazione: (2025)
Don't Waste Bits! Adaptive KV-Cache Quantization for Lightweight On-Device LLMs
di: Boroujeni, Sayed Pedram Haeri, et al.
Pubblicazione: (2026)
di: Boroujeni, Sayed Pedram Haeri, et al.
Pubblicazione: (2026)
LRP-QViT: Mixed-Precision Vision Transformer Quantization via Layer-wise Relevance Propagation
di: Ranjan, Navin, et al.
Pubblicazione: (2024)
di: Ranjan, Navin, et al.
Pubblicazione: (2024)
ElasticDiT: Efficient Diffusion Transformers via Elastic Architecture and Sparse Attention for High-Resolution Image Generation on Mobile Devices
di: Du, Kunpeng, et al.
Pubblicazione: (2026)
di: Du, Kunpeng, et al.
Pubblicazione: (2026)
Quantization without Tears
di: Fu, Minghao, et al.
Pubblicazione: (2024)
di: Fu, Minghao, et al.
Pubblicazione: (2024)
Q$^2$: Quantization-Aware Gradient Balancing and Attention Alignment for Low-Bit Quantization
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
One-Shot Multi-Rate Pruning of Graph Convolutional Networks
di: Sahbi, Hichem
Pubblicazione: (2023)
di: Sahbi, Hichem
Pubblicazione: (2023)
1DFormer: a Transformer Architecture Learning 1D Landmark Representations for Facial Landmark Tracking
di: Yin, Shi, et al.
Pubblicazione: (2023)
di: Yin, Shi, et al.
Pubblicazione: (2023)
DriveVGGT: Calibration-Constrained Visual Geometry Transformers for Multi-Camera Autonomous Driving
di: Jia, Xiaosong, et al.
Pubblicazione: (2025)
di: Jia, Xiaosong, et al.
Pubblicazione: (2025)
MEC-Quant: Maximum Entropy Coding for Extremely Low Bit Quantization-Aware Training
di: Pang, Junbiao, et al.
Pubblicazione: (2025)
di: Pang, Junbiao, et al.
Pubblicazione: (2025)
CondiQuant: Condition Number Based Low-Bit Quantization for Image Super-Resolution
di: Liu, Kai, et al.
Pubblicazione: (2025)
di: Liu, Kai, et al.
Pubblicazione: (2025)
EfficientDM: Efficient Quantization-Aware Fine-Tuning of Low-Bit Diffusion Models
di: He, Yefei, et al.
Pubblicazione: (2023)
di: He, Yefei, et al.
Pubblicazione: (2023)
TreeQ: Pushing the Quantization Boundary of Diffusion Transformer via Tree-Structured Mixed-Precision Search
di: Yang, Kaicheng, et al.
Pubblicazione: (2025)
di: Yang, Kaicheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MPQ-DM: Mixed Precision Quantization for Extremely Low Bit Diffusion Models
di: Feng, Weilun, et al.
Pubblicazione: (2024) -
FLIQS: One-Shot Mixed-Precision Floating-Point and Integer Quantization Search
di: Dotzel, Jordan, et al.
Pubblicazione: (2023) -
Quantization Variation: A New Perspective on Training Transformers with Low-Bit Precision
di: Huang, Xijie, et al.
Pubblicazione: (2023) -
6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models
di: Su, Rundong, et al.
Pubblicazione: (2026) -
DeContext as Defense: Safe Image Editing in Diffusion Transformers
di: Shen, Linghui, et al.
Pubblicazione: (2025)