SQ-DM: Accelerating Diffusion Models with Aggressive Quantization and Temporal Sparsity
Fuente:
arXiv
Salvato in:
| Autori principali: | Fan, Zichen, Dai, Steve, Venkatesan, Rangharajan, Sylvester, Dennis, Khailany, Brucek |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
di: Hooper, Coleman, et al.
Pubblicazione: (2025)
di: Hooper, Coleman, et al.
Pubblicazione: (2025)
Vision Transformer Computation and Resilience for Dynamic Inference
di: Sreedhar, Kavya, et al.
Pubblicazione: (2022)
di: Sreedhar, Kavya, et al.
Pubblicazione: (2022)
CDM-QTA: Quantized Training Acceleration for Efficient LoRA Fine-Tuning of Diffusion Model
di: Lu, Jinming, et al.
Pubblicazione: (2025)
di: Lu, Jinming, et al.
Pubblicazione: (2025)
GauRast: Enhancing GPU Triangle Rasterizers to Accelerate 3D Gaussian Splatting
di: Li, Sixu, et al.
Pubblicazione: (2025)
di: Li, Sixu, et al.
Pubblicazione: (2025)
FG-Attn: Leveraging Fine-Grained Sparsity In Diffusion Transformers
di: Durvasula, Sankeerth, et al.
Pubblicazione: (2025)
di: Durvasula, Sankeerth, et al.
Pubblicazione: (2025)
Revisiting VerilogEval: A Year of Improvements in Large-Language Models for Hardware Code Generation
di: Pinckney, Nathaniel, et al.
Pubblicazione: (2024)
di: Pinckney, Nathaniel, et al.
Pubblicazione: (2024)
Ditto: Accelerating Diffusion Model via Temporal Value Similarity
di: Kim, Sungbin, et al.
Pubblicazione: (2025)
di: Kim, Sungbin, et al.
Pubblicazione: (2025)
MVQ:Towards Efficient DNN Compression and Acceleration with Masked Vector Quantization
di: Li, Shuaiting, et al.
Pubblicazione: (2024)
di: Li, Shuaiting, et al.
Pubblicazione: (2024)
SF-MMCN: Low-Power Sever Flow Multi-Mode Diffusion Model Accelerator
di: Hsu, Huan-Ke, et al.
Pubblicazione: (2024)
di: Hsu, Huan-Ke, et al.
Pubblicazione: (2024)
Model Quantization and Hardware Acceleration for Vision Transformers: A Comprehensive Survey
di: Du, Dayou, et al.
Pubblicazione: (2024)
di: Du, Dayou, et al.
Pubblicazione: (2024)
TIMERIPPLE: Accelerating vDiTs by Understanding the Spatio-Temporal Correlations in Latent Space
di: Miao, Wenxuan, et al.
Pubblicazione: (2025)
di: Miao, Wenxuan, et al.
Pubblicazione: (2025)
ORBIS: Output-Guided Token Reduction with Distribution-Aware Matching for Video Diffusion Acceleration
di: Lee, Hangyeol, et al.
Pubblicazione: (2026)
di: Lee, Hangyeol, et al.
Pubblicazione: (2026)
Real-Time Spacecraft Pose Estimation Using Mixed-Precision Quantized Neural Network on COTS Reconfigurable MPSoC
di: Posso, Julien, et al.
Pubblicazione: (2024)
di: Posso, Julien, et al.
Pubblicazione: (2024)
Vision Transformers on the Edge: A Comprehensive Survey of Model Compression and Acceleration Strategies
di: Saha, Shaibal, et al.
Pubblicazione: (2025)
di: Saha, Shaibal, et al.
Pubblicazione: (2025)
CRISP: Hybrid Structured Sparsity for Class-aware Model Pruning
di: Aggarwal, Shivam, et al.
Pubblicazione: (2023)
di: Aggarwal, Shivam, et al.
Pubblicazione: (2023)
DPD-NeuralEngine: A 22-nm 6.6-TOPS/W/mm$^2$ Recurrent Neural Network Accelerator for Wideband Power Amplifier Digital Pre-Distortion
di: Li, Ang, et al.
Pubblicazione: (2024)
di: Li, Ang, et al.
Pubblicazione: (2024)
A Parameterizable Convolution Accelerator for Embedded Deep Learning Applications
di: Mousouliotis, Panagiotis, et al.
Pubblicazione: (2026)
di: Mousouliotis, Panagiotis, et al.
Pubblicazione: (2026)
Primitive-Driven Acceleration of Hyperdimensional Computing for Real-Time Image Classification
di: Parikh, Dhruv, et al.
Pubblicazione: (2026)
di: Parikh, Dhruv, et al.
Pubblicazione: (2026)
LLM-FP4: 4-Bit Floating-Point Quantized Transformers
di: Liu, Shih-yang, et al.
Pubblicazione: (2023)
di: Liu, Shih-yang, et al.
Pubblicazione: (2023)
DPU or GPU for Accelerating Neural Networks Inference -- Why not both? Split CNN Inference
di: Oztas, Ali Emre, et al.
Pubblicazione: (2026)
di: Oztas, Ali Emre, et al.
Pubblicazione: (2026)
Neo: Real-Time On-Device 3D Gaussian Splatting with Reuse-and-Update Sorting Acceleration
di: Oh, Changhun, et al.
Pubblicazione: (2025)
di: Oh, Changhun, et al.
Pubblicazione: (2025)
SpNeRF: Memory Efficient Sparse Volumetric Neural Rendering Accelerator for Edge Devices
di: Zhang, Yipu, et al.
Pubblicazione: (2025)
di: Zhang, Yipu, et al.
Pubblicazione: (2025)
hARMS: A Hardware Acceleration Architecture for Real-Time Event-Based Optical Flow
di: Stumpp, Daniel C., et al.
Pubblicazione: (2021)
di: Stumpp, Daniel C., et al.
Pubblicazione: (2021)
Accelerating AI and Computer Vision for Satellite Pose Estimation on the Intel Myriad X Embedded SoC
di: Leon, Vasileios, et al.
Pubblicazione: (2024)
di: Leon, Vasileios, et al.
Pubblicazione: (2024)
GS-TG: 3D Gaussian Splatting Accelerator with Tile Grouping for Reducing Redundant Sorting while Preserving Rasterization Efficiency
di: Jo, Joongho, et al.
Pubblicazione: (2025)
di: Jo, Joongho, et al.
Pubblicazione: (2025)
Shedding the Bits: Pushing the Boundaries of Quantization with Minifloats on FPGAs
di: Aggarwal, Shivam, et al.
Pubblicazione: (2023)
di: Aggarwal, Shivam, et al.
Pubblicazione: (2023)
Marco: Configurable Graph-Based Task Solving and Multi-AI Agents Framework for Hardware Design
di: Ho, Chia-Tung, et al.
Pubblicazione: (2025)
di: Ho, Chia-Tung, et al.
Pubblicazione: (2025)
MorphOPC: Advancing Mask Optimization with Multi-scale Hierarchical Morphological Learning
di: Hu, Yuting, et al.
Pubblicazione: (2026)
di: Hu, Yuting, et al.
Pubblicazione: (2026)
Procrastination Is All You Need: Exponent Indexed Accumulators for Floating Point, Posits and Logarithmic Numbers
di: Liguori, Vincenzo
Pubblicazione: (2024)
di: Liguori, Vincenzo
Pubblicazione: (2024)
HOAA: Hybrid Overestimating Approximate Adder for Enhanced Performance Processing Engine
di: Kokane, Omkar, et al.
Pubblicazione: (2024)
di: Kokane, Omkar, et al.
Pubblicazione: (2024)
CHOSEN: Compilation to Hardware Optimization Stack for Efficient Vision Transformer Inference
di: Sadeghi, Mohammad Erfan, et al.
Pubblicazione: (2024)
di: Sadeghi, Mohammad Erfan, et al.
Pubblicazione: (2024)
TinyIceNet: Low-Power SAR Sea Ice Segmentation for On-Board FPGA Inference
di: Koutayni, Mhd Rashed Al, et al.
Pubblicazione: (2026)
di: Koutayni, Mhd Rashed Al, et al.
Pubblicazione: (2026)
From a Lossless (~1.5:1) Compression Algorithm for Llama2 7B Weights to Variable Precision, Variable Range, Compressed Numeric Data Types for CNNs and LLMs
di: Liguori, Vincenzo
Pubblicazione: (2024)
di: Liguori, Vincenzo
Pubblicazione: (2024)
AHCQ-SAM: Toward Accurate and Hardware-Compatible Post-Training Segment Anything Model Quantization
di: Zhang, Wenlun, et al.
Pubblicazione: (2025)
di: Zhang, Wenlun, et al.
Pubblicazione: (2025)
Uni-Render: A Unified Accelerator for Real-Time Rendering Across Diverse Neural Renderers
di: Li, Chaojian, et al.
Pubblicazione: (2025)
di: Li, Chaojian, et al.
Pubblicazione: (2025)
Panacea: Novel DNN Accelerator using Accuracy-Preserving Asymmetric Quantization and Energy-Saving Bit-Slice Sparsity
di: Kam, Dongyun, et al.
Pubblicazione: (2024)
di: Kam, Dongyun, et al.
Pubblicazione: (2024)
ViTCoD: Vision Transformer Acceleration via Dedicated Algorithm and Accelerator Co-Design
di: You, Haoran, et al.
Pubblicazione: (2022)
di: You, Haoran, et al.
Pubblicazione: (2022)
Salca: A Sparsity-Aware Hardware Accelerator for Efficient Long-Context Attention Decoding
di: Fan, Wang, et al.
Pubblicazione: (2026)
di: Fan, Wang, et al.
Pubblicazione: (2026)
GalaxyDiT: Efficient Video Generation with Guidance Alignment and Adaptive Proxy in Diffusion Transformers
di: Song, Zhiye, et al.
Pubblicazione: (2025)
di: Song, Zhiye, et al.
Pubblicazione: (2025)
HYDRA: Hybrid Data Multiplexing and Run-time Layer Configurable DNN Accelerator
di: Kumar, Sonu, et al.
Pubblicazione: (2024)
di: Kumar, Sonu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
di: Hooper, Coleman, et al.
Pubblicazione: (2025) -
Vision Transformer Computation and Resilience for Dynamic Inference
di: Sreedhar, Kavya, et al.
Pubblicazione: (2022) -
CDM-QTA: Quantized Training Acceleration for Efficient LoRA Fine-Tuning of Diffusion Model
di: Lu, Jinming, et al.
Pubblicazione: (2025) -
GauRast: Enhancing GPU Triangle Rasterizers to Accelerate 3D Gaussian Splatting
di: Li, Sixu, et al.
Pubblicazione: (2025) -
FG-Attn: Leveraging Fine-Grained Sparsity In Diffusion Transformers
di: Durvasula, Sankeerth, et al.
Pubblicazione: (2025)