SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Qunyou, Yu, Pengbo, Zapater, Marina, Atienza, David |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mitigating the Bandwidth Wall via Data-Streaming System-Accelerator Co-Design
di: Liu, Qunyou, et al.
Pubblicazione: (2026)
di: Liu, Qunyou, et al.
Pubblicazione: (2026)
MatrixFlow: System-Accelerator co-design for high-performance transformer applications
di: Liu, Qunyou, et al.
Pubblicazione: (2025)
di: Liu, Qunyou, et al.
Pubblicazione: (2025)
Gem5-AcceSys: Enabling System-Level Exploration of Standard Interconnects for Novel Accelerators
di: Liu, Qunyou, et al.
Pubblicazione: (2025)
di: Liu, Qunyou, et al.
Pubblicazione: (2025)
PQA: Exploring the Potential of Product Quantization in DNN Hardware Acceleration
di: AbouElhamayed, Ahmed F., et al.
Pubblicazione: (2023)
di: AbouElhamayed, Ahmed F., et al.
Pubblicazione: (2023)
HASS: Hardware-Aware Sparsity Search for Dataflow DNN Accelerator
di: Yu, Zhewen, et al.
Pubblicazione: (2024)
di: Yu, Zhewen, et al.
Pubblicazione: (2024)
MAx-DNN: Multi-Level Arithmetic Approximation for Energy-Efficient DNN Hardware Accelerators
di: Leon, Vasileios, et al.
Pubblicazione: (2025)
di: Leon, Vasileios, et al.
Pubblicazione: (2025)
CXLRAMSim v1.0: System-Level Exploration of CXL Memory Expander Cards
di: Pathak, Karan, et al.
Pubblicazione: (2026)
di: Pathak, Karan, et al.
Pubblicazione: (2026)
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
Exploring Quantization and Mapping Synergy in Hardware-Aware Deep Neural Network Accelerators
di: Klhufek, Jan, et al.
Pubblicazione: (2024)
di: Klhufek, Jan, et al.
Pubblicazione: (2024)
Hardware-Aware DNN Compression for Homogeneous Edge Devices
di: Zhang, Kunlong, et al.
Pubblicazione: (2025)
di: Zhang, Kunlong, et al.
Pubblicazione: (2025)
Leveraging Highly Approximated Multipliers in DNN Inference
di: Zervakis, Georgios, et al.
Pubblicazione: (2024)
di: Zervakis, Georgios, et al.
Pubblicazione: (2024)
MaRVIn: A Cross-Layer Mixed-Precision RISC-V Framework for DNN Inference, from ISA Extension to Hardware Acceleration
di: Armeniakos, Giorgos, et al.
Pubblicazione: (2025)
di: Armeniakos, Giorgos, et al.
Pubblicazione: (2025)
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
di: Hooper, Coleman, et al.
Pubblicazione: (2025)
di: Hooper, Coleman, et al.
Pubblicazione: (2025)
A Hardware-Aware, Per-Layer Methodology for Post-Training Quantization of Large Language Models
di: Killian, Earl
Pubblicazione: (2026)
di: Killian, Earl
Pubblicazione: (2026)
Exploration of Activation Fault Reliability in Quantized Systolic Array-Based DNN Accelerators
di: Taheri, Mahdi, et al.
Pubblicazione: (2024)
di: Taheri, Mahdi, et al.
Pubblicazione: (2024)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
di: Huang, Wei, et al.
Pubblicazione: (2023)
di: Huang, Wei, et al.
Pubblicazione: (2023)
FORTALESA: Fault-Tolerant Reconfigurable Systolic Array for DNN Inference
di: Cherezova, Natalia, et al.
Pubblicazione: (2025)
di: Cherezova, Natalia, et al.
Pubblicazione: (2025)
PolyLUT: Ultra-low Latency Polynomial Inference with Hardware-Aware Structured Pruning
di: Andronic, Marta, et al.
Pubblicazione: (2025)
di: Andronic, Marta, et al.
Pubblicazione: (2025)
Performance Analysis of DNN Inference/Training with Convolution and non-Convolution Operations
di: Esmaeilzadeh, Hadi, et al.
Pubblicazione: (2023)
di: Esmaeilzadeh, Hadi, et al.
Pubblicazione: (2023)
CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference
di: Chen, Yanru, et al.
Pubblicazione: (2025)
di: Chen, Yanru, et al.
Pubblicazione: (2025)
Accelerating PoT Quantization on Edge Devices
di: Saha, Rappy, et al.
Pubblicazione: (2024)
di: Saha, Rappy, et al.
Pubblicazione: (2024)
DAISM: Digital Approximate In-SRAM Multiplier-based Accelerator for DNN Training and Inference
di: Sonnino, Lorenzo, et al.
Pubblicazione: (2023)
di: Sonnino, Lorenzo, et al.
Pubblicazione: (2023)
vMCU: Coordinated Memory Management and Kernel Optimization for DNN Inference on MCUs
di: Zheng, Size, et al.
Pubblicazione: (2024)
di: Zheng, Size, et al.
Pubblicazione: (2024)
A Precision-Scalable RISC-V DNN Processor with On-Device Learning Capability at the Extreme Edge
di: Huang, Longwei, et al.
Pubblicazione: (2023)
di: Huang, Longwei, et al.
Pubblicazione: (2023)
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
di: Li, Jinhao, et al.
Pubblicazione: (2024)
di: Li, Jinhao, et al.
Pubblicazione: (2024)
SmartQuant: CXL-based AI Model Store in Support of Runtime Configurable Weight Quantization
di: Xie, Rui, et al.
Pubblicazione: (2024)
di: Xie, Rui, et al.
Pubblicazione: (2024)
Algorithm-Hardware Co-Design of Distribution-Aware Logarithmic-Posit Encodings for Efficient DNN Inference
di: Ramachandran, Akshat, et al.
Pubblicazione: (2024)
di: Ramachandran, Akshat, et al.
Pubblicazione: (2024)
Hardware-Efficient Softmax and Layer Normalization with Guaranteed Normalization for Edge Devices
di: Choi, Dawon, et al.
Pubblicazione: (2026)
di: Choi, Dawon, et al.
Pubblicazione: (2026)
SOLE: Hardware-Software Co-design of Softmax and LayerNorm for Efficient Transformer Inference
di: Wang, Wenxun, et al.
Pubblicazione: (2025)
di: Wang, Wenxun, et al.
Pubblicazione: (2025)
FPGA Co-Design for Efficient N:M Sparse and Quantized Model Inference
di: Hsieh, Fen-Yu, et al.
Pubblicazione: (2025)
di: Hsieh, Fen-Yu, et al.
Pubblicazione: (2025)
SeVeDo: A Heterogeneous Transformer Accelerator for Low-Bit Inference via Hierarchical Group Quantization and SVD-Guided Mixed Precision
di: Choi, Yuseon, et al.
Pubblicazione: (2025)
di: Choi, Yuseon, et al.
Pubblicazione: (2025)
Energy-Aware Deep Learning on Resource-Constrained Hardware
di: Millar, Josh, et al.
Pubblicazione: (2025)
di: Millar, Josh, et al.
Pubblicazione: (2025)
KLLM: Fast LLM Inference with K-Means Quantization
di: Wu, Xueying, et al.
Pubblicazione: (2025)
di: Wu, Xueying, et al.
Pubblicazione: (2025)
Full-Stack Optimization for CAM-Only DNN Inference
di: de Lima, João Paulo C., et al.
Pubblicazione: (2024)
di: de Lima, João Paulo C., et al.
Pubblicazione: (2024)
FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs
di: Xie, Xilong, et al.
Pubblicazione: (2025)
di: Xie, Xilong, et al.
Pubblicazione: (2025)
Hardware-Aware Neural Dropout Search for Reliable Uncertainty Prediction on FPGA
di: Zhang, Zehuan, et al.
Pubblicazione: (2024)
di: Zhang, Zehuan, et al.
Pubblicazione: (2024)
CATransformers: Carbon Aware Transformers Through Joint Model-Hardware Optimization
di: Wang, Irene, et al.
Pubblicazione: (2025)
di: Wang, Irene, et al.
Pubblicazione: (2025)
On-Device Qwen2.5: Efficient LLM Inference with Model Compression and Hardware Acceleration
di: Xiang, Maoyang, et al.
Pubblicazione: (2025)
di: Xiang, Maoyang, et al.
Pubblicazione: (2025)
TrainDeeploy: Hardware-Accelerated Parameter-Efficient Fine-Tuning of Small Transformer Models at the Extreme Edge
di: Wang, Run, et al.
Pubblicazione: (2026)
di: Wang, Run, et al.
Pubblicazione: (2026)
Low Power Vision Transformer Accelerator with Hardware-Aware Pruning and Optimized Dataflow
di: Hsiung, Ching-Lin, et al.
Pubblicazione: (2025)
di: Hsiung, Ching-Lin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Mitigating the Bandwidth Wall via Data-Streaming System-Accelerator Co-Design
di: Liu, Qunyou, et al.
Pubblicazione: (2026) -
MatrixFlow: System-Accelerator co-design for high-performance transformer applications
di: Liu, Qunyou, et al.
Pubblicazione: (2025) -
Gem5-AcceSys: Enabling System-Level Exploration of Standard Interconnects for Novel Accelerators
di: Liu, Qunyou, et al.
Pubblicazione: (2025) -
PQA: Exploring the Potential of Product Quantization in DNN Hardware Acceleration
di: AbouElhamayed, Ahmed F., et al.
Pubblicazione: (2023) -
HASS: Hardware-Aware Sparsity Search for Dataflow DNN Accelerator
di: Yu, Zhewen, et al.
Pubblicazione: (2024)