Shedding the Bits: Pushing the Boundaries of Quantization with Minifloats on FPGAs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Aggarwal, Shivam, Damsgaard, Hans Jakob, Pappalardo, Alessandro, Franco, Giuseppe, Preußer, Thomas B., Blott, Michaela, Mitra, Tulika |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A2Q+: Improving Accumulator-Aware Weight Quantization
par: Colbert, Ian, et autres
Publié: (2024)
par: Colbert, Ian, et autres
Publié: (2024)
HiKonv: Maximizing the Throughput of Quantized Convolution With Novel Bit-wise Management and Computation
par: Chen, Yao, et autres
Publié: (2022)
par: Chen, Yao, et autres
Publié: (2022)
Fast Algorithms for Spiking Neural Network Simulation with FPGAs
par: Lindqvist, Björn A., et autres
Publié: (2024)
par: Lindqvist, Björn A., et autres
Publié: (2024)
Heterogeneous Memory Benchmarking Toolkit
par: Ghaemi, Golsana, et autres
Publié: (2025)
par: Ghaemi, Golsana, et autres
Publié: (2025)
TerEffic: Highly Efficient Ternary LLM Inference on FPGA
par: Yin, Chenyang, et autres
Publié: (2025)
par: Yin, Chenyang, et autres
Publié: (2025)
Improving Quantization with Post-Training Model Expansion
par: Franco, Giuseppe, et autres
Publié: (2025)
par: Franco, Giuseppe, et autres
Publié: (2025)
CRISP: Hybrid Structured Sparsity for Class-aware Model Pruning
par: Aggarwal, Shivam, et autres
Publié: (2023)
par: Aggarwal, Shivam, et autres
Publié: (2023)
SWAT: Scalable and Efficient Window Attention-based Transformers Acceleration on FPGAs
par: Bai, Zhenyu, et autres
Publié: (2024)
par: Bai, Zhenyu, et autres
Publié: (2024)
Data-Driven Power Modeling and Monitoring via Hardware Performance Counter Tracking
par: Mazzola, Sergio, et autres
Publié: (2025)
par: Mazzola, Sergio, et autres
Publié: (2025)
HALO: Hardware-aware quantization with low critical-path-delay weights for LLM acceleration
par: Juneja, Rohan, et autres
Publié: (2025)
par: Juneja, Rohan, et autres
Publié: (2025)
PoTAcc: A Pipeline for End-to-End Acceleration of Power-of-Two Quantized DNNs
par: Saha, Rappy, et autres
Publié: (2026)
par: Saha, Rappy, et autres
Publié: (2026)
BitDecoding: Unlocking Tensor Cores for Long-Context LLMs with Low-Bit KV Cache
par: Du, Dayou, et autres
Publié: (2025)
par: Du, Dayou, et autres
Publié: (2025)
SONIQ: System-Optimized Noise-Injected Ultra-Low-Precision Quantization with Full-Precision Parity
par: Zhou, Cyrus, et autres
Publié: (2023)
par: Zhou, Cyrus, et autres
Publié: (2023)
Simulation-Driven Evaluation of Chiplet-Based Architectures Using VisualSim
par: Ali, Wajid, et autres
Publié: (2025)
par: Ali, Wajid, et autres
Publié: (2025)
Enhancing Instruction Prefetching via Cache and TLB Management
par: Jamet, Alexandre Valentin, et autres
Publié: (2026)
par: Jamet, Alexandre Valentin, et autres
Publié: (2026)
ETM2: Empowering Traditional Memory Bandwidth Regulation using ETM
par: Zuepke, Alexander, et autres
Publié: (2026)
par: Zuepke, Alexander, et autres
Publié: (2026)
Towards CPU Performance Prediction: New Challenge Benchmark Dataset and Novel Approach
par: Liu, Xiaoman
Publié: (2024)
par: Liu, Xiaoman
Publié: (2024)
Adaptive Cache Pollution Control for Large Language Model Inference Workloads Using Temporal CNN-Based Prediction and Priority-Aware Replacement
par: Liu, Songze, et autres
Publié: (2025)
par: Liu, Songze, et autres
Publié: (2025)
Recurrent CircuitSAT Sampling for Sequential Circuits
par: Ardakani, Arash, et autres
Publié: (2025)
par: Ardakani, Arash, et autres
Publié: (2025)
Introducing the Arm-membench Throughput Benchmark
par: Burth, Cyrill, et autres
Publié: (2025)
par: Burth, Cyrill, et autres
Publié: (2025)
Enhancing software-hardware co-design for HEP by low-overhead profiling of single- and multi-threaded programs on diverse architectures with Adaptyst
par: Graczyk, Maksymilian, et autres
Publié: (2025)
par: Graczyk, Maksymilian, et autres
Publié: (2025)
SPEC CPU2026: Characterization, Representativeness, and Cross-Suite Comparison
par: Li, Ruihao, et autres
Publié: (2026)
par: Li, Ruihao, et autres
Publié: (2026)
Single 32-bit Sub-Channel DDR5 DIMMs: Architecture, Performance Bounds, and Standardisation
par: Ke, Chih-Hua
Publié: (2026)
par: Ke, Chih-Hua
Publié: (2026)
Regular-Dead on Arrival: Characterizing and Protecting Against Dead-Entry TLB Misses in GPU Microarchitectures
par: Anik, Shafayat Mowla, et autres
Publié: (2026)
par: Anik, Shafayat Mowla, et autres
Publié: (2026)
Makinote: An FPGA-Based HW/SW Platform for Pre-Silicon Emulation of RISC-V Designs
par: Perdomo, Elias, et autres
Publié: (2024)
par: Perdomo, Elias, et autres
Publié: (2024)
AI Load Dynamics--A Power Electronics Perspective
par: Li, Yuzhuo, et autres
Publié: (2025)
par: Li, Yuzhuo, et autres
Publié: (2025)
SAHM: State-Aware Heterogeneous Multicore for Single-Thread Performance
par: Wadle, Shayne, et autres
Publié: (2025)
par: Wadle, Shayne, et autres
Publié: (2025)
ONNXim: A Fast, Cycle-level Multi-core NPU Simulator
par: Ham, Hyungkyu, et autres
Publié: (2024)
par: Ham, Hyungkyu, et autres
Publié: (2024)
LightningSimV2: Faster and Scalable Simulation for High-Level Synthesis via Graph Compilation and Optimization
par: Sarkar, Rishov, et autres
Publié: (2024)
par: Sarkar, Rishov, et autres
Publié: (2024)
Range, Not Precision: Block-Floating-Point Half-Precision FFT and SAR Imaging on Apple Silicon
par: Bergach, Mohamed Amine
Publié: (2026)
par: Bergach, Mohamed Amine
Publié: (2026)
CXL-Interference: Analysis and Characterization in Modern Computer Systems
par: Mao, Shunyu, et autres
Publié: (2024)
par: Mao, Shunyu, et autres
Publié: (2024)
OPTIMA: Design-Space Exploration of Discharge-Based In-SRAM Computing: Quantifying Energy-Accuracy Trade-Offs
par: Seyedfaraji, Saeed, et autres
Publié: (2024)
par: Seyedfaraji, Saeed, et autres
Publié: (2024)
An Analytical Cost Model for Fast Evaluation of Multiple Compute-Engine CNN Accelerators
par: Qararyah, Fareed, et autres
Publié: (2025)
par: Qararyah, Fareed, et autres
Publié: (2025)
Characterizing and Optimizing Realistic Workloads on a Commercial Compute-in-SRAM Device
par: Zhang, Niansong, et autres
Publié: (2025)
par: Zhang, Niansong, et autres
Publié: (2025)
Accelerating Transistor-Level Simulation of Integrated Circuits via Equivalence of RC Long-Chain Structures
par: Tang, Ruibai, et autres
Publié: (2025)
par: Tang, Ruibai, et autres
Publié: (2025)
The Bicameral Cache: a split cache for vector architectures
par: Rebolledo, Susana, et autres
Publié: (2024)
par: Rebolledo, Susana, et autres
Publié: (2024)
A Quantitative Analysis and Guidelines of Data Streaming Accelerator in Modern Intel Xeon Scalable Processors
par: Kuper, Reese, et autres
Publié: (2023)
par: Kuper, Reese, et autres
Publié: (2023)
A$^3$PIM: An Automated, Analytic and Accurate Processing-in-Memory Offloader
par: Jiang, Qingcai, et autres
Publié: (2024)
par: Jiang, Qingcai, et autres
Publié: (2024)
SCALE-Sim v3: A modular cycle-accurate systolic accelerator simulator for end-to-end system analysis
par: Raj, Ritik, et autres
Publié: (2025)
par: Raj, Ritik, et autres
Publié: (2025)
Gem5-AcceSys: Enabling System-Level Exploration of Standard Interconnects for Novel Accelerators
par: Liu, Qunyou, et autres
Publié: (2025)
par: Liu, Qunyou, et autres
Publié: (2025)
Documents similaires
-
A2Q+: Improving Accumulator-Aware Weight Quantization
par: Colbert, Ian, et autres
Publié: (2024) -
HiKonv: Maximizing the Throughput of Quantized Convolution With Novel Bit-wise Management and Computation
par: Chen, Yao, et autres
Publié: (2022) -
Fast Algorithms for Spiking Neural Network Simulation with FPGAs
par: Lindqvist, Björn A., et autres
Publié: (2024) -
Heterogeneous Memory Benchmarking Toolkit
par: Ghaemi, Golsana, et autres
Publié: (2025) -
TerEffic: Highly Efficient Ternary LLM Inference on FPGA
par: Yin, Chenyang, et autres
Publié: (2025)