A Stochastic Rounding-Enabled Low-Precision Floating-Point MAC for DNN Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Ali, Sami Ben, Filip, Silviu-Ioan, Sentieys, Olivier |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
KANtize: Exploring Low-bit Quantization of Kolmogorov-Arnold Networks for Efficient Inference
di: Errabii, Sohaib, et al.
Pubblicazione: (2026)
di: Errabii, Sohaib, et al.
Pubblicazione: (2026)
SWAPPER: Dynamic Operand Swapping in Non-commutative Approximate Circuits for Online Error Reduction
di: Traiola, Marcello, et al.
Pubblicazione: (2025)
di: Traiola, Marcello, et al.
Pubblicazione: (2025)
TimeFloats: Train-in-Memory with Time-Domain Floating-Point Scalar Products
di: Hashem, Maeesha Binte, et al.
Pubblicazione: (2024)
di: Hashem, Maeesha Binte, et al.
Pubblicazione: (2024)
KAN-SAs: Efficient Acceleration of Kolmogorov-Arnold Networks on Systolic Arrays
di: Errabii, Sohaib, et al.
Pubblicazione: (2025)
di: Errabii, Sohaib, et al.
Pubblicazione: (2025)
XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA
di: Yu, Feng, et al.
Pubblicazione: (2026)
di: Yu, Feng, et al.
Pubblicazione: (2026)
A Scalable RISC-V Vector Processor Enabling Efficient Multi-Precision DNN Inference
di: Wang, Chuanning, et al.
Pubblicazione: (2024)
di: Wang, Chuanning, et al.
Pubblicazione: (2024)
SPEED: A Scalable RISC-V Vector Processor Enabling Efficient Multi-Precision DNN Inference
di: Wang, Chuanning, et al.
Pubblicazione: (2024)
di: Wang, Chuanning, et al.
Pubblicazione: (2024)
Range, Not Precision: Block-Floating-Point Half-Precision FFT and SAR Imaging on Apple Silicon
di: Bergach, Mohamed Amine
Pubblicazione: (2026)
di: Bergach, Mohamed Amine
Pubblicazione: (2026)
Floating-Point Multiply-Add with Approximate Normalization for Low-Cost Matrix Engines
di: Alexandridis, Kosmas, et al.
Pubblicazione: (2024)
di: Alexandridis, Kosmas, et al.
Pubblicazione: (2024)
MiniFloat-NN and ExSdotp: An ISA Extension and a Modular Open Hardware Unit for Low-Precision Training on RISC-V cores
di: Bertaccini, Luca, et al.
Pubblicazione: (2022)
di: Bertaccini, Luca, et al.
Pubblicazione: (2022)
MXDOTP: A RISC-V ISA Extension for Enabling Microscaling (MX) Floating-Point Dot Products
di: İslamoğlu, Gamze, et al.
Pubblicazione: (2025)
di: İslamoğlu, Gamze, et al.
Pubblicazione: (2025)
A Hybrid-Domain Floating-Point Compute-in-Memory Architecture for Efficient Acceleration of High-Precision Deep Neural Networks
di: Yi, Zhiqiang, et al.
Pubblicazione: (2025)
di: Yi, Zhiqiang, et al.
Pubblicazione: (2025)
Exploring and Exploiting Runtime Reconfigurable Floating Point Precision in Scientific Computing: a Case Study for Solving PDEs
di: Hao, Cong "Callie"
Pubblicazione: (2024)
di: Hao, Cong "Callie"
Pubblicazione: (2024)
Schrödinger's FP: Dynamic Adaptation of Floating-Point Containers for Deep Learning Training
di: Nikolić, Miloš, et al.
Pubblicazione: (2022)
di: Nikolić, Miloš, et al.
Pubblicazione: (2022)
TransDot: An Area-efficient Reconfigurable Floating-Point Unit for Trans-Precision Dot-Product Accumulation for FPGA AI Engines
di: Wang, Jiayi, et al.
Pubblicazione: (2026)
di: Wang, Jiayi, et al.
Pubblicazione: (2026)
Fast Generation of Custom Floating-Point Spatial Filters on FPGAs
di: Campos, Nelson, et al.
Pubblicazione: (2024)
di: Campos, Nelson, et al.
Pubblicazione: (2024)
Online Alignment and Addition in Multi-Term Floating-Point Adders
di: Alexandridis, Kosmas, et al.
Pubblicazione: (2024)
di: Alexandridis, Kosmas, et al.
Pubblicazione: (2024)
Floating Point HUB Adder for RISC-V Sargantana Processor
di: Bandera, Gerardo, et al.
Pubblicazione: (2024)
di: Bandera, Gerardo, et al.
Pubblicazione: (2024)
Converting Binary Floating-Point Numbers to Shortest Decimal Strings: An Experimental Review
di: Gareau, Jaël Champagne, et al.
Pubblicazione: (2026)
di: Gareau, Jaël Champagne, et al.
Pubblicazione: (2026)
MGS: Markov Greedy Sums for Accurate Low-Bitwidth Floating-Point Accumulation
di: Natesh, Vikas, et al.
Pubblicazione: (2025)
di: Natesh, Vikas, et al.
Pubblicazione: (2025)
Scaling Laws for Floating Point Quantization Training
di: Sun, Xingwu, et al.
Pubblicazione: (2025)
di: Sun, Xingwu, et al.
Pubblicazione: (2025)
BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models
di: Han, Xiaomeng, et al.
Pubblicazione: (2025)
di: Han, Xiaomeng, et al.
Pubblicazione: (2025)
H-FA: A Hybrid Floating-Point and Logarithmic Approach to Hardware Accelerated FlashAttention
di: Alexandridis, Kosmas, et al.
Pubblicazione: (2025)
di: Alexandridis, Kosmas, et al.
Pubblicazione: (2025)
MXFormer: A Microscaling Floating-Point Charge-Trap Transistor Compute-in-Memory Transformer Accelerator
di: Karfakis, George, et al.
Pubblicazione: (2026)
di: Karfakis, George, et al.
Pubblicazione: (2026)
Search Your Block Floating Point Scales!
di: Gupta, Tanmaey, et al.
Pubblicazione: (2026)
di: Gupta, Tanmaey, et al.
Pubblicazione: (2026)
E2AFS: Energy-Efficient Approximate Floating Point Square Rooter for Error Tolerant Computing
di: Goyal, Prateek, et al.
Pubblicazione: (2026)
di: Goyal, Prateek, et al.
Pubblicazione: (2026)
Dual-Issue Execution of Mixed Integer and Floating-Point Workloads on Energy-Efficient In-Order RISC-V Cores
di: Colagrande, Luca, et al.
Pubblicazione: (2025)
di: Colagrande, Luca, et al.
Pubblicazione: (2025)
From Quarter to All: Accelerating Speculative LLM Decoding via Floating-Point Exponent Remapping and Parameter Sharing
di: Zhao, Yushu, et al.
Pubblicazione: (2025)
di: Zhao, Yushu, et al.
Pubblicazione: (2025)
The AetherFloat Family: Block-Scale-Free Quad-Radix Floating-Point Architectures for AI Accelerators
di: Morisaki, Keita
Pubblicazione: (2026)
di: Morisaki, Keita
Pubblicazione: (2026)
4T2R X-ReRAM CiM Array for Variation-tolerant, Low-power, Massively Parallel MAC Operation
di: Kihara, Fuyuki, et al.
Pubblicazione: (2025)
di: Kihara, Fuyuki, et al.
Pubblicazione: (2025)
Voyager: An End-to-End Framework for Design-Space Exploration and Generation of DNN Accelerators
di: Prabhu, Kartik, et al.
Pubblicazione: (2025)
di: Prabhu, Kartik, et al.
Pubblicazione: (2025)
TMA-Adaptive FP8 Grouped GEMM: Eliminating Padding Requirements in Low-Precision Training and Inference on Hopper
di: Su, Zhongling, et al.
Pubblicazione: (2025)
di: Su, Zhongling, et al.
Pubblicazione: (2025)
UFO-MAC: A Unified Framework for Optimization of High-Performance Multipliers and Multiply-Accumulators
di: Zuo, Dongsheng, et al.
Pubblicazione: (2024)
di: Zuo, Dongsheng, et al.
Pubblicazione: (2024)
Inexactness and Correction of Floating-Point Reciprocal, Division and Square Root
di: Dutton, Lucas M., et al.
Pubblicazione: (2024)
di: Dutton, Lucas M., et al.
Pubblicazione: (2024)
A Precision-Scalable RISC-V DNN Processor with On-Device Learning Capability at the Extreme Edge
di: Huang, Longwei, et al.
Pubblicazione: (2023)
di: Huang, Longwei, et al.
Pubblicazione: (2023)
Hardware-Aware DNN Compression for Homogeneous Edge Devices
di: Zhang, Kunlong, et al.
Pubblicazione: (2025)
di: Zhang, Kunlong, et al.
Pubblicazione: (2025)
DORA: Dataflow-Instruction Orchestration Architecture for DNN Acceleration
di: Chen, Xingzhen, et al.
Pubblicazione: (2026)
di: Chen, Xingzhen, et al.
Pubblicazione: (2026)
On Approximate 8-bit Floating-Point Operations Using Integer Operations
di: Lindberg, Theodor, et al.
Pubblicazione: (2024)
di: Lindberg, Theodor, et al.
Pubblicazione: (2024)
Table-Lookup MAC: Scalable Processing of Quantised Neural Networks in FPGA Soft Logic
di: Gerlinghoff, Daniel, et al.
Pubblicazione: (2024)
di: Gerlinghoff, Daniel, et al.
Pubblicazione: (2024)
Commercial Evaluation of Zero-Skipping MAC Design for Bit Sparsity Exploitation in DL Inference
di: Nair, Harideep, et al.
Pubblicazione: (2024)
di: Nair, Harideep, et al.
Pubblicazione: (2024)
Documenti analoghi
-
KANtize: Exploring Low-bit Quantization of Kolmogorov-Arnold Networks for Efficient Inference
di: Errabii, Sohaib, et al.
Pubblicazione: (2026) -
SWAPPER: Dynamic Operand Swapping in Non-commutative Approximate Circuits for Online Error Reduction
di: Traiola, Marcello, et al.
Pubblicazione: (2025) -
TimeFloats: Train-in-Memory with Time-Domain Floating-Point Scalar Products
di: Hashem, Maeesha Binte, et al.
Pubblicazione: (2024) -
KAN-SAs: Efficient Acceleration of Kolmogorov-Arnold Networks on Systolic Arrays
di: Errabii, Sohaib, et al.
Pubblicazione: (2025) -
XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA
di: Yu, Feng, et al.
Pubblicazione: (2026)