Architectural Implications of Neural Network Inference for High Data-Rate, Low-Latency Scientific Applications
Fuente:
arXiv
Guardado en:
| Autores principales: | Weng, Olivia, Redding, Alexander, Tran, Nhan, Duarte, Javier Mauricio, Kastner, Ryan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Design Rules for Extreme-Edge Scientific Computing on AI Engines
por: Ma, Zhenghua, et al.
Publicado: (2026)
por: Ma, Zhenghua, et al.
Publicado: (2026)
A System Architecture for Low Latency Multiprogramming Quantum Computing
por: Zhao, Yilun, et al.
Publicado: (2026)
por: Zhao, Yilun, et al.
Publicado: (2026)
Topkima-Former: Low-energy, Low-Latency Inference for Transformers using top-k In-memory ADC
por: Dong, Shuai, et al.
Publicado: (2024)
por: Dong, Shuai, et al.
Publicado: (2024)
LPU: A Latency-Optimized and Highly Scalable Processor for Large Language Model Inference
por: Moon, Seungjae, et al.
Publicado: (2024)
por: Moon, Seungjae, et al.
Publicado: (2024)
A Low-Latency FFT-IFFT Cascade Architecture
por: Parhi, Keshab K.
Publicado: (2023)
por: Parhi, Keshab K.
Publicado: (2023)
LL-GNN: Low Latency Graph Neural Networks on FPGAs for High Energy Physics
por: Que, Zhiqiang, et al.
Publicado: (2022)
por: Que, Zhiqiang, et al.
Publicado: (2022)
AgileWatts: An Energy-Efficient CPU Core Idle-State Architecture for Latency-Sensitive Server Applications
por: Yahya, Jawad Haj, et al.
Publicado: (2022)
por: Yahya, Jawad Haj, et al.
Publicado: (2022)
XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA
por: Yu, Feng, et al.
Publicado: (2026)
por: Yu, Feng, et al.
Publicado: (2026)
A Case for Kolmogorov-Arnold Networks in Prefetching: Towards Low-Latency, Generalizable ML-Based Prefetchers
por: Kulkarni, Dhruv, et al.
Publicado: (2025)
por: Kulkarni, Dhruv, et al.
Publicado: (2025)
FireBridge: Cycle-Accurate Hardware + Firmware Co-Verification for Modern Accelerators
por: Abarajithan, G, et al.
Publicado: (2026)
por: Abarajithan, G, et al.
Publicado: (2026)
A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network
por: Jiang, Aojie, et al.
Publicado: (2026)
por: Jiang, Aojie, et al.
Publicado: (2026)
High Utilization Energy-Aware Real-Time Inference Deep Convolutional Neural Network Accelerator
por: Lin, Kuan-Ting, et al.
Publicado: (2025)
por: Lin, Kuan-Ting, et al.
Publicado: (2025)
Data-Rate-Aware High-Speed CNN Inference on FPGAs
por: Habermann, Tobias, et al.
Publicado: (2026)
por: Habermann, Tobias, et al.
Publicado: (2026)
Low Power Approximate Multiplier Architecture for Deep Neural Networks
por: Jaswal, Pragun, et al.
Publicado: (2025)
por: Jaswal, Pragun, et al.
Publicado: (2025)
TOP: Towards Open & Predictable Heterogeneous SoCs
por: Valente, Luca, et al.
Publicado: (2024)
por: Valente, Luca, et al.
Publicado: (2024)
NeuroBlend: Towards Low-Power yet Accurate Neural Network-Based Inference Engine Blending Binary and Fixed-Point Convolutions
por: Fayyazi, Arash, et al.
Publicado: (2023)
por: Fayyazi, Arash, et al.
Publicado: (2023)
A Hybrid-Domain Floating-Point Compute-in-Memory Architecture for Efficient Acceleration of High-Precision Deep Neural Networks
por: Yi, Zhiqiang, et al.
Publicado: (2025)
por: Yi, Zhiqiang, et al.
Publicado: (2025)
PolyLUT: Learning Piecewise Polynomials for Ultra-Low Latency FPGA LUT-based Inference
por: Andronic, Marta, et al.
Publicado: (2023)
por: Andronic, Marta, et al.
Publicado: (2023)
ONNX-to-Hardware Design Flow for Adaptive Neural-Network Inference on FPGAs
por: Manca, Federico, et al.
Publicado: (2024)
por: Manca, Federico, et al.
Publicado: (2024)
Evaluation of GPU Video Encoder for Low-Latency Real-Time 4K UHD Encoding
por: Arunruangsirilert, Kasidis, et al.
Publicado: (2025)
por: Arunruangsirilert, Kasidis, et al.
Publicado: (2025)
Enhancing LUT-based Deep Neural Networks Inference through Architecture and Connectivity Optimization
por: Lou, Binglei, et al.
Publicado: (2026)
por: Lou, Binglei, et al.
Publicado: (2026)
Low-Latency FPGA Control System for Real-Time Neural Network Processing in CCD-Based Trapped-Ion Qubit Measurement
por: Lou, Binglei, et al.
Publicado: (2025)
por: Lou, Binglei, et al.
Publicado: (2025)
Architectural Classification of XR Workloads: Cross-Layer Archetypes and Implications
por: Shi, Xinyu, et al.
Publicado: (2026)
por: Shi, Xinyu, et al.
Publicado: (2026)
Configurable Multi-Port Memory Architecture for High-Speed Data Communication
por: Dhakad, Narendra Singh, et al.
Publicado: (2024)
por: Dhakad, Narendra Singh, et al.
Publicado: (2024)
Table-Lookup MAC: Scalable Processing of Quantised Neural Networks in FPGA Soft Logic
por: Gerlinghoff, Daniel, et al.
Publicado: (2024)
por: Gerlinghoff, Daniel, et al.
Publicado: (2024)
FireFly-S: Exploiting Dual-Side Sparsity for Spiking Neural Networks Acceleration with Reconfigurable Spatial Architecture
por: Li, Tenglong, et al.
Publicado: (2024)
por: Li, Tenglong, et al.
Publicado: (2024)
CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge
por: Tian, Chunlin, et al.
Publicado: (2025)
por: Tian, Chunlin, et al.
Publicado: (2025)
System-Level Design Space Exploration for High-Level Synthesis under End-to-End Latency Constraints
por: Liao, Yuchao, et al.
Publicado: (2024)
por: Liao, Yuchao, et al.
Publicado: (2024)
Efficient Sparse Processing-in-Memory Architecture (ESPIM) for Machine Learning Inference
por: He, Mingxuan, et al.
Publicado: (2024)
por: He, Mingxuan, et al.
Publicado: (2024)
LoopLynx: A Scalable Dataflow Architecture for Efficient LLM Inference
por: Zheng, Jianing, et al.
Publicado: (2025)
por: Zheng, Jianing, et al.
Publicado: (2025)
LinkBo: An Adaptive Single-Wire, Low-Latency, and Fault-Tolerant Communications Interface for Variable-Distance Chip-to-Chip Systems
por: Ye, Bochen, et al.
Publicado: (2025)
por: Ye, Bochen, et al.
Publicado: (2025)
Reconfigurable Stream Network Architecture
por: Wang, Chengyue, et al.
Publicado: (2024)
por: Wang, Chengyue, et al.
Publicado: (2024)
SpikeStream: Accelerating Spiking Neural Network Inference on RISC-V Clusters with Sparse Computation Extensions
por: Manoni, Simone, et al.
Publicado: (2025)
por: Manoni, Simone, et al.
Publicado: (2025)
Low Latency GNN Accelerator for Quantum Error Correction
por: Cicero, Alessio, et al.
Publicado: (2026)
por: Cicero, Alessio, et al.
Publicado: (2026)
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
por: Xuan, Zihao, et al.
Publicado: (2026)
por: Xuan, Zihao, et al.
Publicado: (2026)
MultiVic: A Time-Predictable RISC-V Multi-Core Processor Optimized for Neural Network Inference
por: Kirschner, Maximilian, et al.
Publicado: (2025)
por: Kirschner, Maximilian, et al.
Publicado: (2025)
Work-in-Progress: Real-Time Neural Network Inference on a Custom RISC-V Multicore Vector Processor
por: Kirschner, Maximilian, et al.
Publicado: (2024)
por: Kirschner, Maximilian, et al.
Publicado: (2024)
DPUV4E: High-Throughput DPU Architecture Design for CNN on Versal ACAP
por: Li, Guoyu, et al.
Publicado: (2025)
por: Li, Guoyu, et al.
Publicado: (2025)
ReLANCE: A Resource-Efficient Low-Latency Cortical Neural Acceleration Engine
por: Kumar, Sonu, et al.
Publicado: (2025)
por: Kumar, Sonu, et al.
Publicado: (2025)
TENET: An Efficient Sparsity-Aware LUT-Centric Architecture for Ternary LLM Inference On Edge
por: Huang, Zhirui, et al.
Publicado: (2025)
por: Huang, Zhirui, et al.
Publicado: (2025)
Ejemplares similares
-
Design Rules for Extreme-Edge Scientific Computing on AI Engines
por: Ma, Zhenghua, et al.
Publicado: (2026) -
A System Architecture for Low Latency Multiprogramming Quantum Computing
por: Zhao, Yilun, et al.
Publicado: (2026) -
Topkima-Former: Low-energy, Low-Latency Inference for Transformers using top-k In-memory ADC
por: Dong, Shuai, et al.
Publicado: (2024) -
LPU: A Latency-Optimized and Highly Scalable Processor for Large Language Model Inference
por: Moon, Seungjae, et al.
Publicado: (2024) -
A Low-Latency FFT-IFFT Cascade Architecture
por: Parhi, Keshab K.
Publicado: (2023)