Procrastination Is All You Need: Exponent Indexed Accumulators for Floating Point, Posits and Logarithmic Numbers
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Liguori, Vincenzo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From a Lossless (~1.5:1) Compression Algorithm for Llama2 7B Weights to Variable Precision, Variable Range, Compressed Numeric Data Types for CNNs and LLMs
par: Liguori, Vincenzo
Publié: (2024)
par: Liguori, Vincenzo
Publié: (2024)
LLM-FP4: 4-Bit Floating-Point Quantized Transformers
par: Liu, Shih-yang, et autres
Publié: (2023)
par: Liu, Shih-yang, et autres
Publié: (2023)
CORDIC Is All You Need
par: Kokane, Omkar, et autres
Publié: (2025)
par: Kokane, Omkar, et autres
Publié: (2025)
EULER-ADAS: Energy-Efficient & SIMD-Unified Logarithmic-Posit Engine for Precision-Reconfigurable Approximate ADAS Acceleration
par: Lokhande, Mukul, et autres
Publié: (2026)
par: Lokhande, Mukul, et autres
Publié: (2026)
DPD-NeuralEngine: A 22-nm 6.6-TOPS/W/mm$^2$ Recurrent Neural Network Accelerator for Wideband Power Amplifier Digital Pre-Distortion
par: Li, Ang, et autres
Publié: (2024)
par: Li, Ang, et autres
Publié: (2024)
HOAA: Hybrid Overestimating Approximate Adder for Enhanced Performance Processing Engine
par: Kokane, Omkar, et autres
Publié: (2024)
par: Kokane, Omkar, et autres
Publié: (2024)
Real-Time Spacecraft Pose Estimation Using Mixed-Precision Quantized Neural Network on COTS Reconfigurable MPSoC
par: Posso, Julien, et autres
Publié: (2024)
par: Posso, Julien, et autres
Publié: (2024)
CHOSEN: Compilation to Hardware Optimization Stack for Efficient Vision Transformer Inference
par: Sadeghi, Mohammad Erfan, et autres
Publié: (2024)
par: Sadeghi, Mohammad Erfan, et autres
Publié: (2024)
MorphOPC: Advancing Mask Optimization with Multi-scale Hierarchical Morphological Learning
par: Hu, Yuting, et autres
Publié: (2026)
par: Hu, Yuting, et autres
Publié: (2026)
TinyIceNet: Low-Power SAR Sea Ice Segmentation for On-Board FPGA Inference
par: Koutayni, Mhd Rashed Al, et autres
Publié: (2026)
par: Koutayni, Mhd Rashed Al, et autres
Publié: (2026)
CDM-QTA: Quantized Training Acceleration for Efficient LoRA Fine-Tuning of Diffusion Model
par: Lu, Jinming, et autres
Publié: (2025)
par: Lu, Jinming, et autres
Publié: (2025)
Formal that "Floats" High: Formal Verification of Floating Point Arithmetic
par: Mohanty, Hansa, et autres
Publié: (2025)
par: Mohanty, Hansa, et autres
Publié: (2025)
FabGPT: An Efficient Large Multimodal Model for Complex Wafer Defect Knowledge Queries
par: Jiang, Yuqi, et autres
Publié: (2024)
par: Jiang, Yuqi, et autres
Publié: (2024)
Assessing the Added Value of Onboard Earth Observation Processing with the IRIDE HEO Service Segment
par: Thind, Parampuneet Kaur, et autres
Publié: (2026)
par: Thind, Parampuneet Kaur, et autres
Publié: (2026)
Real-World Deployment of a Lane Change Prediction Architecture Based on Knowledge Graph Embeddings and Bayesian Inference
par: Manzour, M., et autres
Publié: (2025)
par: Manzour, M., et autres
Publié: (2025)
TSLA: A Task-Specific Learning Adaptation for Semantic Segmentation on Autonomous Vehicles Platform
par: Liu, Jun, et autres
Publié: (2025)
par: Liu, Jun, et autres
Publié: (2025)
fpgaHART: A toolflow for throughput-oriented acceleration of 3D CNNs for HAR onto FPGAs
par: Toupas, Petros, et autres
Publié: (2023)
par: Toupas, Petros, et autres
Publié: (2023)
SQ-DM: Accelerating Diffusion Models with Aggressive Quantization and Temporal Sparsity
par: Fan, Zichen, et autres
Publié: (2025)
par: Fan, Zichen, et autres
Publié: (2025)
SageAttention2++: A More Efficient Implementation of SageAttention2
par: Zhang, Jintao, et autres
Publié: (2025)
par: Zhang, Jintao, et autres
Publié: (2025)
Real-Time Semantic Segmentation of Aerial Images Using an Embedded U-Net: A Comparison of CPU, GPU, and FPGA Workflows
par: Posso, Julien, et autres
Publié: (2025)
par: Posso, Julien, et autres
Publié: (2025)
Design Insights and Comparative Evaluation of a Hardware-Based Cooperative Perception Architecture for Lane Change Prediction
par: Manzour, Mohamed, et autres
Publié: (2025)
par: Manzour, Mohamed, et autres
Publié: (2025)
Rapid-INR: Storage Efficient CPU-free DNN Training Using Implicit Neural Representation
par: Chen, Hanqiu, et autres
Publié: (2023)
par: Chen, Hanqiu, et autres
Publié: (2023)
FMM-X3D: FPGA-based modeling and mapping of X3D for Human Action Recognition
par: Toupas, Petros, et autres
Publié: (2023)
par: Toupas, Petros, et autres
Publié: (2023)
Efficient FIR filtering with Bit Layer Multiply Accumulator
par: Liguori, Vincenzo
Publié: (2024)
par: Liguori, Vincenzo
Publié: (2024)
Model Quantization and Hardware Acceleration for Vision Transformers: A Comprehensive Survey
par: Du, Dayou, et autres
Publié: (2024)
par: Du, Dayou, et autres
Publié: (2024)
HYDRA: Hybrid Data Multiplexing and Run-time Layer Configurable DNN Accelerator
par: Kumar, Sonu, et autres
Publié: (2024)
par: Kumar, Sonu, et autres
Publié: (2024)
Image2Net: Datasets, Benchmark and Hybrid Framework to Convert Analog Circuit Diagrams into Netlists
par: Xu, Haohang, et autres
Publié: (2025)
par: Xu, Haohang, et autres
Publié: (2025)
Shedding the Bits: Pushing the Boundaries of Quantization with Minifloats on FPGAs
par: Aggarwal, Shivam, et autres
Publié: (2023)
par: Aggarwal, Shivam, et autres
Publié: (2023)
XR-NPE: High-Throughput Mixed-precision SIMD Neural Processing Engine for Extended Reality Perception Workloads
par: Chaudhari, Tejas, et autres
Publié: (2025)
par: Chaudhari, Tejas, et autres
Publié: (2025)
SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit Training
par: Zhang, Jintao, et autres
Publié: (2025)
par: Zhang, Jintao, et autres
Publié: (2025)
VTR: An Optimized Vision Transformer for SAR ATR Acceleration on FPGA
par: Wickramasinghe, Sachini, et autres
Publié: (2024)
par: Wickramasinghe, Sachini, et autres
Publié: (2024)
From Quarter to All: Accelerating Speculative LLM Decoding via Floating-Point Exponent Remapping and Parameter Sharing
par: Zhao, Yushu, et autres
Publié: (2025)
par: Zhao, Yushu, et autres
Publié: (2025)
Fair and Square: Replacing One Real Multiplication with a Single Square and One Complex Multiplication with Three Squares When Performing Matrix Multiplication and Convolutions
par: Liguori, Vincenzo
Publié: (2026)
par: Liguori, Vincenzo
Publié: (2026)
AppSign: Multi-level Approximate Computing for Real-Time Traffic Sign Recognition in Autonomous Vehicles
par: Omidian, Fatemeh, et autres
Publié: (2024)
par: Omidian, Fatemeh, et autres
Publié: (2024)
Co-designing a Sub-millisecond Latency Event-based Eye Tracking System with Submanifold Sparse CNN
par: Zhang, Baoheng, et autres
Publié: (2024)
par: Zhang, Baoheng, et autres
Publié: (2024)
MVQ:Towards Efficient DNN Compression and Acceleration with Masked Vector Quantization
par: Li, Shuaiting, et autres
Publié: (2024)
par: Li, Shuaiting, et autres
Publié: (2024)
Identifying Unnecessary 3D Gaussians using Clustering for Fast Rendering of 3D Gaussian Splatting
par: Jo, Joongho, et autres
Publié: (2024)
par: Jo, Joongho, et autres
Publié: (2024)
SF-MMCN: Low-Power Sever Flow Multi-Mode Diffusion Model Accelerator
par: Hsu, Huan-Ke, et autres
Publié: (2024)
par: Hsu, Huan-Ke, et autres
Publié: (2024)
CAMO: Correlation-Aware Mask Optimization with Modulated Reinforcement Learning
par: Liang, Xiaoxiao, et autres
Publié: (2024)
par: Liang, Xiaoxiao, et autres
Publié: (2024)
Accelerating AI and Computer Vision for Satellite Pose Estimation on the Intel Myriad X Embedded SoC
par: Leon, Vasileios, et autres
Publié: (2024)
par: Leon, Vasileios, et autres
Publié: (2024)
Documents similaires
-
From a Lossless (~1.5:1) Compression Algorithm for Llama2 7B Weights to Variable Precision, Variable Range, Compressed Numeric Data Types for CNNs and LLMs
par: Liguori, Vincenzo
Publié: (2024) -
LLM-FP4: 4-Bit Floating-Point Quantized Transformers
par: Liu, Shih-yang, et autres
Publié: (2023) -
CORDIC Is All You Need
par: Kokane, Omkar, et autres
Publié: (2025) -
EULER-ADAS: Energy-Efficient & SIMD-Unified Logarithmic-Posit Engine for Precision-Reconfigurable Approximate ADAS Acceleration
par: Lokhande, Mukul, et autres
Publié: (2026) -
DPD-NeuralEngine: A 22-nm 6.6-TOPS/W/mm$^2$ Recurrent Neural Network Accelerator for Wideband Power Amplifier Digital Pre-Distortion
par: Li, Ang, et autres
Publié: (2024)