StruM: Structured Mixed Precision for Efficient Deep Learning Hardware Codesign
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Michael, Raha, Arnab, Mathaikutty, Deepak A., Langhammer, Martin, Tunali, Engin, Sharma, Daksha |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FlexNN: A Dataflow-aware Flexible Deep Learning Accelerator for Energy-Efficient Edge Devices
di: Raha, Arnab, et al.
Pubblicazione: (2024)
di: Raha, Arnab, et al.
Pubblicazione: (2024)
SPARQLe: Sub-Precision Activation Representation for Quantized LLM Inference
di: Parvathy, Aradhana Mohan, et al.
Pubblicazione: (2026)
di: Parvathy, Aradhana Mohan, et al.
Pubblicazione: (2026)
Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
GraNNite: Enabling High-Performance Execution of Graph Neural Networks on Resource-Constrained Neural Processing Units
di: Das, Arghadip, et al.
Pubblicazione: (2025)
di: Das, Arghadip, et al.
Pubblicazione: (2025)
Soft GPGPU versus IP cores: Quantifying and Reducing the Performance Gap
di: Langhammer, Martin, et al.
Pubblicazione: (2024)
di: Langhammer, Martin, et al.
Pubblicazione: (2024)
Banked Memories for Soft SIMT Processors
di: Langhammer, Martin, et al.
Pubblicazione: (2025)
di: Langhammer, Martin, et al.
Pubblicazione: (2025)
A Statically and Dynamically Scalable Soft GPGPU
di: Langhammer, Martin, et al.
Pubblicazione: (2024)
di: Langhammer, Martin, et al.
Pubblicazione: (2024)
TYTAN: Taylor-series based Non-Linear Activation Engine for Deep Learning Accelerators
di: Pramanik, Soham, et al.
Pubblicazione: (2025)
di: Pramanik, Soham, et al.
Pubblicazione: (2025)
A 950 MHz SIMT Soft Processor
di: Langhammer, Martin, et al.
Pubblicazione: (2025)
di: Langhammer, Martin, et al.
Pubblicazione: (2025)
SafeCiM: Investigating Resilience of Hybrid Floating-Point Compute-in-Memory Deep Learning Accelerators
di: Bhattacharya, Swastik, et al.
Pubblicazione: (2025)
di: Bhattacharya, Swastik, et al.
Pubblicazione: (2025)
A 14ns-Latency 9Gb/s 0.44mm$^2$ 62pJ/b Short-Blocklength LDPC Decoder ASIC in 22FDX
di: Nonaca, Darja, et al.
Pubblicazione: (2025)
di: Nonaca, Darja, et al.
Pubblicazione: (2025)
Memory-Guided Unified Hardware Accelerator for Mixed-Precision Scientific Computing
di: Wang, Chuanzhen, et al.
Pubblicazione: (2026)
di: Wang, Chuanzhen, et al.
Pubblicazione: (2026)
Efficient Precision-Scalable Hardware for Microscaling (MX) Processing in Robotics Learning
di: Cuyckens, Stef, et al.
Pubblicazione: (2025)
di: Cuyckens, Stef, et al.
Pubblicazione: (2025)
TTP: A Hardware-Efficient Design for Precise Prefetching in Ray Tracing
di: Tozlu, Yavuz Selim, et al.
Pubblicazione: (2026)
di: Tozlu, Yavuz Selim, et al.
Pubblicazione: (2026)
HDReason: Algorithm-Hardware Codesign for Hyperdimensional Knowledge Graph Reasoning
di: Chen, Hanning, et al.
Pubblicazione: (2024)
di: Chen, Hanning, et al.
Pubblicazione: (2024)
XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA
di: Yu, Feng, et al.
Pubblicazione: (2026)
di: Yu, Feng, et al.
Pubblicazione: (2026)
Mozart: A Chiplet Ecosystem-Accelerator Codesign Framework for Composable Bespoke Application Specific Integrated Circuits
di: Jin, Haoran, et al.
Pubblicazione: (2025)
di: Jin, Haoran, et al.
Pubblicazione: (2025)
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
di: Hooper, Coleman, et al.
Pubblicazione: (2025)
di: Hooper, Coleman, et al.
Pubblicazione: (2025)
ACCESS-AV: Adaptive Communication-Computation Codesign for Sustainable Autonomous Vehicle Localization in Smart Factories
di: Bhattacharjya, Rajat, et al.
Pubblicazione: (2025)
di: Bhattacharjya, Rajat, et al.
Pubblicazione: (2025)
TATAA: Programmable Mixed-Precision Transformer Acceleration with a Transformable Arithmetic Architecture
di: Wu, Jiajun, et al.
Pubblicazione: (2024)
di: Wu, Jiajun, et al.
Pubblicazione: (2024)
HCiM: ADC-Less Hybrid Analog-Digital Compute in Memory Accelerator for Deep Learning Workloads
di: Negi, Shubham, et al.
Pubblicazione: (2024)
di: Negi, Shubham, et al.
Pubblicazione: (2024)
In-Memory Computing Architecture for Efficient Hardware Security
di: Ajmi, Hala, et al.
Pubblicazione: (2024)
di: Ajmi, Hala, et al.
Pubblicazione: (2024)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
di: Huang, Wei, et al.
Pubblicazione: (2023)
di: Huang, Wei, et al.
Pubblicazione: (2023)
A Power-Efficient Hardware Implementation of L-Mul
di: Chen, Ruiqi, et al.
Pubblicazione: (2024)
di: Chen, Ruiqi, et al.
Pubblicazione: (2024)
An Efficient Sparse Hardware Accelerator for Spike-Driven Transformer
di: Li, Zhengke, et al.
Pubblicazione: (2025)
di: Li, Zhengke, et al.
Pubblicazione: (2025)
Hardware-Software Co-Design for Accelerating Transformer Inference Leveraging Compute-in-Memory
di: Kim, Dong Eun, et al.
Pubblicazione: (2025)
di: Kim, Dong Eun, et al.
Pubblicazione: (2025)
Rescaling-Aware Training for Efficient Deployment of Deep Learning Models on Full-Integer Hardware
di: Mueller, Lion, et al.
Pubblicazione: (2025)
di: Mueller, Lion, et al.
Pubblicazione: (2025)
FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs
di: Xie, Xilong, et al.
Pubblicazione: (2025)
di: Xie, Xilong, et al.
Pubblicazione: (2025)
Partially-Precise Computing Paradigm for Efficient Hardware Implementation of Application-Specific Embedded Systems
di: Faryabi, Mohsen, et al.
Pubblicazione: (2024)
di: Faryabi, Mohsen, et al.
Pubblicazione: (2024)
Hardware-Centric Analysis of DeepSeek's Multi-Head Latent Attention
di: Geens, Robin, et al.
Pubblicazione: (2025)
di: Geens, Robin, et al.
Pubblicazione: (2025)
Energy-Efficient Hardware Acceleration of Whisper ASR on a CGLA
di: Ando, Takuto, et al.
Pubblicazione: (2025)
di: Ando, Takuto, et al.
Pubblicazione: (2025)
Kratos: An FPGA Benchmark for Unrolled DNNs with Fine-Grained Sparsity and Mixed Precision
di: Dai, Xilai, et al.
Pubblicazione: (2024)
di: Dai, Xilai, et al.
Pubblicazione: (2024)
FETTA: Flexible and Efficient Hardware Accelerator for Tensorized Neural Network Training
di: Lu, Jinming, et al.
Pubblicazione: (2025)
di: Lu, Jinming, et al.
Pubblicazione: (2025)
SeDA: Secure and Efficient DNN Accelerators with Hardware/Software Synergy
di: Xuan, Wei, et al.
Pubblicazione: (2025)
di: Xuan, Wei, et al.
Pubblicazione: (2025)
SiTe CiM: Signed Ternary Computing-in-Memory for Ultra-Low Precision Deep Neural Networks
di: Thakuria, Niharika, et al.
Pubblicazione: (2024)
di: Thakuria, Niharika, et al.
Pubblicazione: (2024)
A Hybrid-Domain Floating-Point Compute-in-Memory Architecture for Efficient Acceleration of High-Precision Deep Neural Networks
di: Yi, Zhiqiang, et al.
Pubblicazione: (2025)
di: Yi, Zhiqiang, et al.
Pubblicazione: (2025)
Energy-Aware Deep Learning on Resource-Constrained Hardware
di: Millar, Josh, et al.
Pubblicazione: (2025)
di: Millar, Josh, et al.
Pubblicazione: (2025)
FuzzWiz -- Fuzzing Framework for Efficient Hardware Coverage
di: Gadde, Deepak Narayan, et al.
Pubblicazione: (2024)
di: Gadde, Deepak Narayan, et al.
Pubblicazione: (2024)
Towards Efficient Design Verification -- Constrained Random Verification using PyUVM
di: Gadde, Deepak Narayan, et al.
Pubblicazione: (2024)
di: Gadde, Deepak Narayan, et al.
Pubblicazione: (2024)
Hardware-Efficient CNNs: Interleaved Approximate FP32 Multipliers for Kernel Computation
di: Gowda, Bindu G, et al.
Pubblicazione: (2025)
di: Gowda, Bindu G, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FlexNN: A Dataflow-aware Flexible Deep Learning Accelerator for Energy-Efficient Edge Devices
di: Raha, Arnab, et al.
Pubblicazione: (2024) -
SPARQLe: Sub-Precision Activation Representation for Quantized LLM Inference
di: Parvathy, Aradhana Mohan, et al.
Pubblicazione: (2026) -
Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025) -
GraNNite: Enabling High-Performance Execution of Graph Neural Networks on Resource-Constrained Neural Processing Units
di: Das, Arghadip, et al.
Pubblicazione: (2025) -
Soft GPGPU versus IP cores: Quantifying and Reducing the Performance Gap
di: Langhammer, Martin, et al.
Pubblicazione: (2024)