USEFUSE: Uniform Stride for Enhanced Performance in Fused Layer Architecture of Deep Neural Networks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ibrahim, Muhammad Sohail, Usman, Muhammad, Lee, Jeong-A |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Automatic Generation of Fast and Accurate Performance Models for Deep Neural Network Accelerators
par: Lübeck, Konstantin, et autres
Publié: (2024)
par: Lübeck, Konstantin, et autres
Publié: (2024)
DEEP-GAP: Deep-learning Evaluation of Execution Parallelism in GPU Architectural Performance
par: Palaniappan, Kathiravan
Publié: (2026)
par: Palaniappan, Kathiravan
Publié: (2026)
Concorde: Fast and Accurate CPU Performance Modeling with Compositional Analytical-ML Fusion
par: Nasr-Esfahany, Arash, et autres
Publié: (2025)
par: Nasr-Esfahany, Arash, et autres
Publié: (2025)
Understanding the Performance Horizon of the Latest ML Workloads with NonGEMM Workloads
par: Karami, Rachid, et autres
Publié: (2024)
par: Karami, Rachid, et autres
Publié: (2024)
Optimizing Attention on GPUs by Exploiting GPU Architectural NUMA Effects
par: Choudhary, Mansi, et autres
Publié: (2025)
par: Choudhary, Mansi, et autres
Publié: (2025)
A2Q+: Improving Accumulator-Aware Weight Quantization
par: Colbert, Ian, et autres
Publié: (2024)
par: Colbert, Ian, et autres
Publié: (2024)
Graph neural networks with configuration cross-attention for tensor compilers
par: Khizbullin, Dmitrii, et autres
Publié: (2024)
par: Khizbullin, Dmitrii, et autres
Publié: (2024)
PoTAcc: A Pipeline for End-to-End Acceleration of Power-of-Two Quantized DNNs
par: Saha, Rappy, et autres
Publié: (2026)
par: Saha, Rappy, et autres
Publié: (2026)
Toward A Formalized Approach for Spike Sorting Algorithms and Hardware Evaluation
par: Zhang, Tim, et autres
Publié: (2022)
par: Zhang, Tim, et autres
Publié: (2022)
Search Your Block Floating Point Scales!
par: Gupta, Tanmaey, et autres
Publié: (2026)
par: Gupta, Tanmaey, et autres
Publié: (2026)
SONIQ: System-Optimized Noise-Injected Ultra-Low-Precision Quantization with Full-Precision Parity
par: Zhou, Cyrus, et autres
Publié: (2023)
par: Zhou, Cyrus, et autres
Publié: (2023)
GCL-Sampler: Discovering Kernel Similarity for Sampled GPU Simulation via Graph Contrastive Learning
par: Wang, Jiaqi, et autres
Publié: (2026)
par: Wang, Jiaqi, et autres
Publié: (2026)
Prefill vs. Decode Bottlenecks: SRAM-Frequency Tradeoffs and the Memory-Bandwidth Ceiling
par: Atmer, Hannah, et autres
Publié: (2025)
par: Atmer, Hannah, et autres
Publié: (2025)
PyGim: An Efficient Graph Neural Network Library for Real Processing-In-Memory Architectures
par: Giannoula, Christina, et autres
Publié: (2024)
par: Giannoula, Christina, et autres
Publié: (2024)
On Latency Predictors for Neural Architecture Search
par: Akhauri, Yash, et autres
Publié: (2024)
par: Akhauri, Yash, et autres
Publié: (2024)
NSFlow: An End-to-End FPGA Framework with Scalable Dataflow Architecture for Neuro-Symbolic AI
par: Yang, Hanchen, et autres
Publié: (2025)
par: Yang, Hanchen, et autres
Publié: (2025)
DSLR-CNN: Efficient CNN Acceleration using Digit-Serial Left-to-Right Arithmetic
par: Nisar, Malik Zohaib, et autres
Publié: (2025)
par: Nisar, Malik Zohaib, et autres
Publié: (2025)
L2R-CIPU: Efficient CNN Computation with Left-to-Right Composite Inner Product Units
par: Nisar, Malik Zohaib, et autres
Publié: (2024)
par: Nisar, Malik Zohaib, et autres
Publié: (2024)
Forecasting LLM Inference Performance via Hardware-Agnostic Analytical Modeling
par: Patwari, Rajeev, et autres
Publié: (2025)
par: Patwari, Rajeev, et autres
Publié: (2025)
Confidential LLM Inference: Performance and Cost Across CPU and GPU TEEs
par: Chrapek, Marcin, et autres
Publié: (2025)
par: Chrapek, Marcin, et autres
Publié: (2025)
It's all about PR -- Smart Benchmarking AI Accelerators using Performance Representatives
par: Jung, Alexander Louis-Ferdinand, et autres
Publié: (2024)
par: Jung, Alexander Louis-Ferdinand, et autres
Publié: (2024)
Single 32-bit Sub-Channel DDR5 DIMMs: Architecture, Performance Bounds, and Standardisation
par: Ke, Chih-Hua
Publié: (2026)
par: Ke, Chih-Hua
Publié: (2026)
Neural Architecture Search of Hybrid Models for NPU-CIM Heterogeneous AR/VR Devices
par: Zhao, Yiwei, et autres
Publié: (2024)
par: Zhao, Yiwei, et autres
Publié: (2024)
Improving the Serving Performance of Multi-LoRA Large Language Models via Efficient LoRA and KV Cache Management
par: Zhang, Hang, et autres
Publié: (2025)
par: Zhang, Hang, et autres
Publié: (2025)
Unveiling the Potential of Quantization with MXFP4: Strategies for Quantization Error Reduction
par: Chhugani, Jatin, et autres
Publié: (2026)
par: Chhugani, Jatin, et autres
Publié: (2026)
Fusing Depthwise and Pointwise Convolutions for Efficient Inference on GPUs
par: Qararyah, Fareed, et autres
Publié: (2024)
par: Qararyah, Fareed, et autres
Publié: (2024)
Simulation-Driven Evaluation of Chiplet-Based Architectures Using VisualSim
par: Ali, Wajid, et autres
Publié: (2025)
par: Ali, Wajid, et autres
Publié: (2025)
ACALSim: A Scalable Parallel Simulation Framework for High-Performance System Design Space Exploration
par: Lin, Wei-Fen, et autres
Publié: (2026)
par: Lin, Wei-Fen, et autres
Publié: (2026)
Characterizing and Understanding HGNN Training on GPUs
par: Han, Dengke, et autres
Publié: (2024)
par: Han, Dengke, et autres
Publié: (2024)
Design Space Exploration of Approximate Computing Techniques with a Reinforcement Learning Approach
par: Saeedi, Sepide, et autres
Publié: (2023)
par: Saeedi, Sepide, et autres
Publié: (2023)
LowRA: Accurate and Efficient LoRA Fine-Tuning of LLMs under 2 Bits
par: Zhou, Zikai, et autres
Publié: (2025)
par: Zhou, Zikai, et autres
Publié: (2025)
Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes
par: Hendria, Willy Fitra
Publié: (2026)
par: Hendria, Willy Fitra
Publié: (2026)
SparAMX: Accelerating Compressed LLMs Token Generation on AMX-powered CPUs
par: AbouElhamayed, Ahmed F., et autres
Publié: (2025)
par: AbouElhamayed, Ahmed F., et autres
Publié: (2025)
RooflineBench: A Benchmarking Framework for On-Device LLMs via Roofline Analysis
par: Bi, Zhen, et autres
Publié: (2026)
par: Bi, Zhen, et autres
Publié: (2026)
FlexiSAGA: A Flexible Systolic Array GEMM Accelerator for Sparse and Dense Processing
par: Müller, Mika Markus, et autres
Publié: (2025)
par: Müller, Mika Markus, et autres
Publié: (2025)
DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures
par: Yang, Peiming, et autres
Publié: (2025)
par: Yang, Peiming, et autres
Publié: (2025)
DEER: Deep Runahead for Instruction Prefetching on Modern Mobile Workloads
par: Vahdatniya, Parmida, et autres
Publié: (2025)
par: Vahdatniya, Parmida, et autres
Publié: (2025)
SAHM: State-Aware Heterogeneous Multicore for Single-Thread Performance
par: Wadle, Shayne, et autres
Publié: (2025)
par: Wadle, Shayne, et autres
Publié: (2025)
A Quantitative Analysis and Guidelines of Data Streaming Accelerator in Modern Intel Xeon Scalable Processors
par: Kuper, Reese, et autres
Publié: (2023)
par: Kuper, Reese, et autres
Publié: (2023)
Enhancing Instruction Prefetching via Cache and TLB Management
par: Jamet, Alexandre Valentin, et autres
Publié: (2026)
par: Jamet, Alexandre Valentin, et autres
Publié: (2026)
Documents similaires
-
Automatic Generation of Fast and Accurate Performance Models for Deep Neural Network Accelerators
par: Lübeck, Konstantin, et autres
Publié: (2024) -
DEEP-GAP: Deep-learning Evaluation of Execution Parallelism in GPU Architectural Performance
par: Palaniappan, Kathiravan
Publié: (2026) -
Concorde: Fast and Accurate CPU Performance Modeling with Compositional Analytical-ML Fusion
par: Nasr-Esfahany, Arash, et autres
Publié: (2025) -
Understanding the Performance Horizon of the Latest ML Workloads with NonGEMM Workloads
par: Karami, Rachid, et autres
Publié: (2024) -
Optimizing Attention on GPUs by Exploiting GPU Architectural NUMA Effects
par: Choudhary, Mansi, et autres
Publié: (2025)