Kratos: An FPGA Benchmark for Unrolled DNNs with Fine-Grained Sparsity and Mixed Precision
Fuente:
arXiv
Salvato in:
| Autori principali: | Dai, Xilai, Chen, Yuzong, Abdelfattah, Mohamed S. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BBS: Bi-directional Bit-level Sparsity for Deep Learning Acceleration
di: Chen, Yuzong, et al.
Pubblicazione: (2024)
di: Chen, Yuzong, et al.
Pubblicazione: (2024)
P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats
di: Chen, Yuzong, et al.
Pubblicazione: (2025)
di: Chen, Yuzong, et al.
Pubblicazione: (2025)
Double Duty: FPGA Architecture to Enable Concurrent LUT and Adder Chain Usage
di: Pun, Junius, et al.
Pubblicazione: (2025)
di: Pun, Junius, et al.
Pubblicazione: (2025)
BitMoD: Bit-serial Mixture-of-Datatype LLM Acceleration
di: Chen, Yuzong, et al.
Pubblicazione: (2024)
di: Chen, Yuzong, et al.
Pubblicazione: (2024)
XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA
di: Yu, Feng, et al.
Pubblicazione: (2026)
di: Yu, Feng, et al.
Pubblicazione: (2026)
VolTune: A Fine-Grained Runtime Voltage Control Architecture for FPGA Systems
di: Ahmed, Akram Ben, et al.
Pubblicazione: (2026)
di: Ahmed, Akram Ben, et al.
Pubblicazione: (2026)
FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs
di: Xie, Xilong, et al.
Pubblicazione: (2025)
di: Xie, Xilong, et al.
Pubblicazione: (2025)
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
di: Hooper, Coleman, et al.
Pubblicazione: (2025)
di: Hooper, Coleman, et al.
Pubblicazione: (2025)
An ECC-based Fault Tolerance Approach for DNNs
di: Raji, Mohsen, et al.
Pubblicazione: (2025)
di: Raji, Mohsen, et al.
Pubblicazione: (2025)
Bombyx: OpenCilk Compilation for FPGA Hardware Acceleration
di: Shahawy, Mohamed, et al.
Pubblicazione: (2025)
di: Shahawy, Mohamed, et al.
Pubblicazione: (2025)
A 28.6 mJ/iter Stable Diffusion Processor for Text-to-Image Generation with Patch Similarity-based Sparsity Augmentation and Text-based Mixed-Precision
di: Choi, Jiwon, et al.
Pubblicazione: (2024)
di: Choi, Jiwon, et al.
Pubblicazione: (2024)
Compromising the Intelligence of Modern DNNs: On the Effectiveness of Targeted RowPress
di: Zhou, Ranyang, et al.
Pubblicazione: (2024)
di: Zhou, Ranyang, et al.
Pubblicazione: (2024)
FASE: FPGA-Assisted Syscall Emulation for Rapid End-to-End Processor Performance Validation
di: Meng, Chengzhen, et al.
Pubblicazione: (2025)
di: Meng, Chengzhen, et al.
Pubblicazione: (2025)
TransDot: An Area-efficient Reconfigurable Floating-Point Unit for Trans-Precision Dot-Product Accumulation for FPGA AI Engines
di: Wang, Jiayi, et al.
Pubblicazione: (2026)
di: Wang, Jiayi, et al.
Pubblicazione: (2026)
ARAS: An Adaptive Low-Cost ReRAM-Based Accelerator for DNNs
di: Sabri, Mohammad, et al.
Pubblicazione: (2024)
di: Sabri, Mohammad, et al.
Pubblicazione: (2024)
RangeGuard: Efficient, Bounded Approximate Error Correction for Reliable DNNs
di: Ko, Hanum, et al.
Pubblicazione: (2026)
di: Ko, Hanum, et al.
Pubblicazione: (2026)
FG-Attn: Leveraging Fine-Grained Sparsity In Diffusion Transformers
di: Durvasula, Sankeerth, et al.
Pubblicazione: (2025)
di: Durvasula, Sankeerth, et al.
Pubblicazione: (2025)
FPGA & VPU Co-Processing in Space Applications: Development and Testing with DSP/AI Benchmarks
di: Leon, Vasileios, et al.
Pubblicazione: (2025)
di: Leon, Vasileios, et al.
Pubblicazione: (2025)
Stream: Design Space Exploration of Layer-Fused DNNs on Heterogeneous Dataflow Accelerators
di: Symons, Arne, et al.
Pubblicazione: (2022)
di: Symons, Arne, et al.
Pubblicazione: (2022)
Late Breaking Results: CHESSY: Coupled Hybrid Emulation with SystemC-FPGA Synchronization
di: Ruotolo, Lorenzo, et al.
Pubblicazione: (2026)
di: Ruotolo, Lorenzo, et al.
Pubblicazione: (2026)
Memory-Guided Unified Hardware Accelerator for Mixed-Precision Scientific Computing
di: Wang, Chuanzhen, et al.
Pubblicazione: (2026)
di: Wang, Chuanzhen, et al.
Pubblicazione: (2026)
A High-Throughput FPGA Accelerator for Lightweight CNNs With Balanced Dataflow
di: Zhao, Zhiyuan, et al.
Pubblicazione: (2024)
di: Zhao, Zhiyuan, et al.
Pubblicazione: (2024)
Holistic Optimization Framework for FPGA Accelerators
di: Pouget, Stéphane, et al.
Pubblicazione: (2025)
di: Pouget, Stéphane, et al.
Pubblicazione: (2025)
Range, Not Precision: Block-Floating-Point Half-Precision FFT and SAR Imaging on Apple Silicon
di: Bergach, Mohamed Amine
Pubblicazione: (2026)
di: Bergach, Mohamed Amine
Pubblicazione: (2026)
TATAA: Programmable Mixed-Precision Transformer Acceleration with a Transformable Arithmetic Architecture
di: Wu, Jiajun, et al.
Pubblicazione: (2024)
di: Wu, Jiajun, et al.
Pubblicazione: (2024)
StruM: Structured Mixed Precision for Efficient Deep Learning Hardware Codesign
di: Wu, Michael, et al.
Pubblicazione: (2025)
di: Wu, Michael, et al.
Pubblicazione: (2025)
FastFlow in FPGA Stacks of Data Centers
di: Paul, Rourab, et al.
Pubblicazione: (2024)
di: Paul, Rourab, et al.
Pubblicazione: (2024)
Demystifying FPGA Hard NoC Performance
di: Liu, Sihao, et al.
Pubblicazione: (2025)
di: Liu, Sihao, et al.
Pubblicazione: (2025)
FPGA-based Hyrbid Memory Emulation System
di: Wen, Fei, et al.
Pubblicazione: (2020)
di: Wen, Fei, et al.
Pubblicazione: (2020)
Prosperity: Accelerating Spiking Neural Networks via Product Sparsity
di: Wei, Chiyue, et al.
Pubblicazione: (2025)
di: Wei, Chiyue, et al.
Pubblicazione: (2025)
Hummingbird: A Smaller and Faster Large Language Model Accelerator on Embedded FPGA
di: Li, Jindong, et al.
Pubblicazione: (2025)
di: Li, Jindong, et al.
Pubblicazione: (2025)
FPPS: An FPGA-Based Point Cloud Processing System
di: Zhou, Xiaofeng, et al.
Pubblicazione: (2026)
di: Zhou, Xiaofeng, et al.
Pubblicazione: (2026)
Efficient and Accurate Graph Classification with Hyperdimensional Computing on FPGA
di: Arockiaraj, Jebacyril, et al.
Pubblicazione: (2025)
di: Arockiaraj, Jebacyril, et al.
Pubblicazione: (2025)
Design and Implementation of BNN-Based Object Detection on FPGA
di: Zhao, Xuyu, et al.
Pubblicazione: (2026)
di: Zhao, Xuyu, et al.
Pubblicazione: (2026)
LUTstructions: Self-loading FPGA-based Reconfigurable Instructions
di: Papaphilippou, Philippos
Pubblicazione: (2026)
di: Papaphilippou, Philippos
Pubblicazione: (2026)
Implementation and Analysis of Thermometer Encoding in DWN FPGA Accelerators
di: Mecik, Michael, et al.
Pubblicazione: (2025)
di: Mecik, Michael, et al.
Pubblicazione: (2025)
An FPGA Compiler for On-the-Fly Adaptive CNN Deployment and Reconfiguration
di: Mazouz, Alaa, et al.
Pubblicazione: (2025)
di: Mazouz, Alaa, et al.
Pubblicazione: (2025)
Neuromorphic Processor Employing FPGA Technology with Universal Interconnections
di: Harlikar, Pracheta, et al.
Pubblicazione: (2025)
di: Harlikar, Pracheta, et al.
Pubblicazione: (2025)
EMiX: Emulating Beyond Single-FPGA Limits
di: Kropotov, Alexander, et al.
Pubblicazione: (2026)
di: Kropotov, Alexander, et al.
Pubblicazione: (2026)
Piccolo: Large-Scale Graph Processing with Fine-Grained In-Memory Scatter-Gather
di: Shin, Changmin, et al.
Pubblicazione: (2025)
di: Shin, Changmin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
BBS: Bi-directional Bit-level Sparsity for Deep Learning Acceleration
di: Chen, Yuzong, et al.
Pubblicazione: (2024) -
P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats
di: Chen, Yuzong, et al.
Pubblicazione: (2025) -
Double Duty: FPGA Architecture to Enable Concurrent LUT and Adder Chain Usage
di: Pun, Junius, et al.
Pubblicazione: (2025) -
BitMoD: Bit-serial Mixture-of-Datatype LLM Acceleration
di: Chen, Yuzong, et al.
Pubblicazione: (2024) -
XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA
di: Yu, Feng, et al.
Pubblicazione: (2026)