Accelerating PoT Quantization on Edge Devices
Fuente:
arXiv
Salvato in:
| Autori principali: | Saha, Rappy, Haris, Jude, Cano, José |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Designing Efficient LLM Accelerators for Edge Devices
di: Haris, Jude, et al.
Pubblicazione: (2024)
di: Haris, Jude, et al.
Pubblicazione: (2024)
PoTAcc: A Pipeline for End-to-End Acceleration of Power-of-Two Quantized DNNs
di: Saha, Rappy, et al.
Pubblicazione: (2026)
di: Saha, Rappy, et al.
Pubblicazione: (2026)
Accelerating Transposed Convolutions on FPGA-based Edge Devices
di: Haris, Jude, et al.
Pubblicazione: (2025)
di: Haris, Jude, et al.
Pubblicazione: (2025)
F-BFQ: Flexible Block Floating-Point Quantization Accelerator for LLMs
di: Haris, Jude, et al.
Pubblicazione: (2025)
di: Haris, Jude, et al.
Pubblicazione: (2025)
LLM-Driven Design Space Exploration of FPGA-based Accelerators
di: Sharma, Vinamra, et al.
Pubblicazione: (2026)
di: Sharma, Vinamra, et al.
Pubblicazione: (2026)
ITA: An Energy-Efficient Attention and Softmax Accelerator for Quantized Transformers
di: İslamoğlu, Gamze, et al.
Pubblicazione: (2023)
di: İslamoğlu, Gamze, et al.
Pubblicazione: (2023)
PQA: Exploring the Potential of Product Quantization in DNN Hardware Acceleration
di: AbouElhamayed, Ahmed F., et al.
Pubblicazione: (2023)
di: AbouElhamayed, Ahmed F., et al.
Pubblicazione: (2023)
SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
di: Liu, Qunyou, et al.
Pubblicazione: (2026)
di: Liu, Qunyou, et al.
Pubblicazione: (2026)
EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture
di: Duan, Bowen, et al.
Pubblicazione: (2026)
di: Duan, Bowen, et al.
Pubblicazione: (2026)
Hardware-Efficient Softmax and Layer Normalization with Guaranteed Normalization for Edge Devices
di: Choi, Dawon, et al.
Pubblicazione: (2026)
di: Choi, Dawon, et al.
Pubblicazione: (2026)
PolyThrottle: Energy-efficient Neural Network Inference on Edge Devices
di: Yan, Minghao, et al.
Pubblicazione: (2023)
di: Yan, Minghao, et al.
Pubblicazione: (2023)
Exploration of Activation Fault Reliability in Quantized Systolic Array-Based DNN Accelerators
di: Taheri, Mahdi, et al.
Pubblicazione: (2024)
di: Taheri, Mahdi, et al.
Pubblicazione: (2024)
Exploring Quantization and Mapping Synergy in Hardware-Aware Deep Neural Network Accelerators
di: Klhufek, Jan, et al.
Pubblicazione: (2024)
di: Klhufek, Jan, et al.
Pubblicazione: (2024)
Binary Weight Multi-Bit Activation Quantization for Compute-in-Memory CNN Accelerators
di: Zhou, Wenyong, et al.
Pubblicazione: (2025)
di: Zhou, Wenyong, et al.
Pubblicazione: (2025)
MixDiT: Accelerating Image Diffusion Transformer Inference with Mixed-Precision MX Quantization
di: Kim, Daeun, et al.
Pubblicazione: (2025)
di: Kim, Daeun, et al.
Pubblicazione: (2025)
Dynamic Tsetlin Machine Accelerators for On-Chip Training at the Edge using FPGAs
di: Mao, Gang, et al.
Pubblicazione: (2025)
di: Mao, Gang, et al.
Pubblicazione: (2025)
Decentor-V: Lightweight ML Training on Low-Power RISC-V Edge Devices
di: Ribeiro, Marcelo, et al.
Pubblicazione: (2025)
di: Ribeiro, Marcelo, et al.
Pubblicazione: (2025)
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
di: Hooper, Coleman, et al.
Pubblicazione: (2025)
di: Hooper, Coleman, et al.
Pubblicazione: (2025)
COBRA: Algorithm-Architecture Co-optimized Binary Transformer Accelerator for Edge Inference
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
Atleus: Accelerating Transformers on the Edge Enabled by 3D Heterogeneous Manycore Architectures
di: Dhingra, Pratyush, et al.
Pubblicazione: (2025)
di: Dhingra, Pratyush, et al.
Pubblicazione: (2025)
A Precision-Scalable RISC-V DNN Processor with On-Device Learning Capability at the Extreme Edge
di: Huang, Longwei, et al.
Pubblicazione: (2023)
di: Huang, Longwei, et al.
Pubblicazione: (2023)
TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference
di: Chen, Yanru, et al.
Pubblicazione: (2025)
di: Chen, Yanru, et al.
Pubblicazione: (2025)
On-Device Qwen2.5: Efficient LLM Inference with Model Compression and Hardware Acceleration
di: Xiang, Maoyang, et al.
Pubblicazione: (2025)
di: Xiang, Maoyang, et al.
Pubblicazione: (2025)
TrainDeeploy: Hardware-Accelerated Parameter-Efficient Fine-Tuning of Small Transformer Models at the Extreme Edge
di: Wang, Run, et al.
Pubblicazione: (2026)
di: Wang, Run, et al.
Pubblicazione: (2026)
P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats
di: Chen, Yuzong, et al.
Pubblicazione: (2025)
di: Chen, Yuzong, et al.
Pubblicazione: (2025)
SeVeDo: A Heterogeneous Transformer Accelerator for Low-Bit Inference via Hierarchical Group Quantization and SVD-Guided Mixed Precision
di: Choi, Yuseon, et al.
Pubblicazione: (2025)
di: Choi, Yuseon, et al.
Pubblicazione: (2025)
TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
AXELRAM: Quantize Once, Never Dequantize
di: Nishida, Yasushi
Pubblicazione: (2026)
di: Nishida, Yasushi
Pubblicazione: (2026)
LOTION: Smoothing the Optimization Landscape for Quantized Training
di: Kwun, Mujin, et al.
Pubblicazione: (2025)
di: Kwun, Mujin, et al.
Pubblicazione: (2025)
KLLM: Fast LLM Inference with K-Means Quantization
di: Wu, Xueying, et al.
Pubblicazione: (2025)
di: Wu, Xueying, et al.
Pubblicazione: (2025)
Clo-HDnn: A 4.66 TFLOPS/W and 3.78 TOPS/W Continual On-Device Learning Accelerator with Energy-efficient Hyperdimensional Computing via Progressive Search
di: Song, Chang Eun, et al.
Pubblicazione: (2025)
di: Song, Chang Eun, et al.
Pubblicazione: (2025)
FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression
di: Qiao, Ye, et al.
Pubblicazione: (2026)
di: Qiao, Ye, et al.
Pubblicazione: (2026)
Histogram-Equalized Quantization for logic-gated Residual Neural Networks
di: Nguyen, Van Thien, et al.
Pubblicazione: (2025)
di: Nguyen, Van Thien, et al.
Pubblicazione: (2025)
Deep Learning-Based Anomaly Detection in Spacecraft Telemetry on Edge Devices
di: Goetze, Christopher, et al.
Pubblicazione: (2026)
di: Goetze, Christopher, et al.
Pubblicazione: (2026)
OPAL: Outlier-Preserved Microscaling Quantization Accelerator for Generative Large Language Models
di: Koo, Jahyun, et al.
Pubblicazione: (2024)
di: Koo, Jahyun, et al.
Pubblicazione: (2024)
Low-Energy On-Device Personalization for MCUs
di: Huang, Yushan, et al.
Pubblicazione: (2024)
di: Huang, Yushan, et al.
Pubblicazione: (2024)
GCoD: Graph Convolutional Network Acceleration via Dedicated Algorithm and Accelerator Co-Design
di: You, Haoran, et al.
Pubblicazione: (2021)
di: You, Haoran, et al.
Pubblicazione: (2021)
FPGA Co-Design for Efficient N:M Sparse and Quantized Model Inference
di: Hsieh, Fen-Yu, et al.
Pubblicazione: (2025)
di: Hsieh, Fen-Yu, et al.
Pubblicazione: (2025)
MicroScopiQ: Accelerating Foundational Models through Outlier-Aware Microscaling Quantization
di: Ramachandran, Akshat, et al.
Pubblicazione: (2024)
di: Ramachandran, Akshat, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Designing Efficient LLM Accelerators for Edge Devices
di: Haris, Jude, et al.
Pubblicazione: (2024) -
PoTAcc: A Pipeline for End-to-End Acceleration of Power-of-Two Quantized DNNs
di: Saha, Rappy, et al.
Pubblicazione: (2026) -
Accelerating Transposed Convolutions on FPGA-based Edge Devices
di: Haris, Jude, et al.
Pubblicazione: (2025) -
F-BFQ: Flexible Block Floating-Point Quantization Accelerator for LLMs
di: Haris, Jude, et al.
Pubblicazione: (2025) -
LLM-Driven Design Space Exploration of FPGA-based Accelerators
di: Sharma, Vinamra, et al.
Pubblicazione: (2026)