Fusing Depthwise and Pointwise Convolutions for Efficient Inference on GPUs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qararyah, Fareed, Azhar, Muhammad Waqar, Maleki, Mohammad Ali, Trancoso, Pedro |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Analytical Cost Model for Fast Evaluation of Multiple Compute-Engine CNN Accelerators
par: Qararyah, Fareed, et autres
Publié: (2025)
par: Qararyah, Fareed, et autres
Publié: (2025)
Compiler Support for Speculation in Decoupled Access/Execute Architectures
par: Szafarczyk, Robert, et autres
Publié: (2025)
par: Szafarczyk, Robert, et autres
Publié: (2025)
EDEA: Efficient Dual-Engine Accelerator for Depthwise Separable Convolution with Direct Data Transfer
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
Optimizing Attention on GPUs by Exploiting GPU Architectural NUMA Effects
par: Choudhary, Mansi, et autres
Publié: (2025)
par: Choudhary, Mansi, et autres
Publié: (2025)
Profiling Concurrent Vision Inference Workloads on NVIDIA Jetson -- Extended
par: Chakraborty, Abhinaba, et autres
Publié: (2025)
par: Chakraborty, Abhinaba, et autres
Publié: (2025)
ZKProphet: Understanding Performance of Zero-Knowledge Proofs on GPUs
par: Verma, Tarunesh, et autres
Publié: (2025)
par: Verma, Tarunesh, et autres
Publié: (2025)
Spira: Exploiting Voxel Data Structural Properties for Efficient Sparse Convolution in Point Cloud Networks
par: Adamopoulos, Dionysios, et autres
Publié: (2025)
par: Adamopoulos, Dionysios, et autres
Publié: (2025)
Experimental Assessment of Containers Running on Top of Virtual Machines
par: Aqasizade, Hossein, et autres
Publié: (2024)
par: Aqasizade, Hossein, et autres
Publié: (2024)
Exploring and Evaluating Real-world CXL: Use Cases and System Adoption
par: Wang, Xi, et autres
Publié: (2024)
par: Wang, Xi, et autres
Publié: (2024)
Exploiting long vectors with a CFD code: a co-design show case
par: Blancafort, Marc, et autres
Publié: (2024)
par: Blancafort, Marc, et autres
Publié: (2024)
Simopt -- Simulation pass for Speculative Optimisation of FPGA-CAD flow
par: Wadhwa, Eashan, et autres
Publié: (2024)
par: Wadhwa, Eashan, et autres
Publié: (2024)
GigaAPI for GPU Parallelization
par: Suvarna, M., et autres
Publié: (2025)
par: Suvarna, M., et autres
Publié: (2025)
Performance Analysis of HPC applications on the Aurora Supercomputer: Exploring the Impact of HBM-Enabled Intel Xeon Max CPUs
par: Ibeid, Huda, et autres
Publié: (2025)
par: Ibeid, Huda, et autres
Publié: (2025)
UPMEM Unleashed: Software Secrets for Speed
par: Chmielewski, Krystian, et autres
Publié: (2025)
par: Chmielewski, Krystian, et autres
Publié: (2025)
Dissecting the NVIDIA Hopper Architecture through Microbenchmarking and Multiple Level Analysis
par: Luo, Weile, et autres
Publié: (2025)
par: Luo, Weile, et autres
Publié: (2025)
Parallelizing a modern GPU simulator
par: Huerta, Rodrigo, et autres
Publié: (2025)
par: Huerta, Rodrigo, et autres
Publié: (2025)
Can Asymmetric Tile Buffering Be Beneficial?
par: Wang, Chengyue, et autres
Publié: (2025)
par: Wang, Chengyue, et autres
Publié: (2025)
ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression
par: Fan, Ruibo, et autres
Publié: (2026)
par: Fan, Ruibo, et autres
Publié: (2026)
ARKV: Adaptive and Resource-Efficient KV Cache Management under Limited Memory Budget for Long-Context Inference in LLMs
par: Lei, Jianlong, et autres
Publié: (2026)
par: Lei, Jianlong, et autres
Publié: (2026)
PyGim: An Efficient Graph Neural Network Library for Real Processing-In-Memory Architectures
par: Giannoula, Christina, et autres
Publié: (2024)
par: Giannoula, Christina, et autres
Publié: (2024)
Characterizing and Optimizing LLM Inference Workloads on CPU-GPU Coupled Architectures
par: Vellaisamy, Prabhu, et autres
Publié: (2025)
par: Vellaisamy, Prabhu, et autres
Publié: (2025)
Cloud to Edge: Benchmarking LLM Inference On Hardware-Accelerated Single-Board Computers
par: Renney, Harri, et autres
Publié: (2026)
par: Renney, Harri, et autres
Publié: (2026)
Vector-Centric Machine Learning Systems: A Cross-Stack Approach
par: Jiang, Wenqi
Publié: (2025)
par: Jiang, Wenqi
Publié: (2025)
Performance Implications of Multi-Chiplet Neural Processing Units on Autonomous Driving Perception
par: Odema, Mohanad, et autres
Publié: (2024)
par: Odema, Mohanad, et autres
Publié: (2024)
Efficient Hardware Accelerator Based on Medium Granularity Dataflow for SpTRSV
par: Chen, Qian, et autres
Publié: (2024)
par: Chen, Qian, et autres
Publié: (2024)
Linear Layouts: Robust Code Generation of Efficient Tensor Computation Using $\mathbb{F}_2$
par: Zhou, Keren, et autres
Publié: (2025)
par: Zhou, Keren, et autres
Publié: (2025)
DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures
par: Yang, Peiming, et autres
Publié: (2025)
par: Yang, Peiming, et autres
Publié: (2025)
Evaluating Emerging AI/ML Accelerators: IPU, RDU, and NVIDIA/AMD GPUs
par: Peng, Hongwu, et autres
Publié: (2023)
par: Peng, Hongwu, et autres
Publié: (2023)
Kitsune: Enabling Dataflow Execution on GPUs
par: Davies, Michael, et autres
Publié: (2025)
par: Davies, Michael, et autres
Publié: (2025)
SGDRC: Software-Defined Dynamic Resource Control for Concurrent DNN Inference on NVIDIA GPUs
par: Zhang, Yongkang, et autres
Publié: (2024)
par: Zhang, Yongkang, et autres
Publié: (2024)
Optimized thread-block arrangement in a GPU implementation of a linear solver for atmospheric chemistry mechanisms
par: Ruiz, Christian Guzman, et autres
Publié: (2024)
par: Ruiz, Christian Guzman, et autres
Publié: (2024)
Evaluating the Potential of In-Memory Processing to Accelerate Homomorphic Encryption
par: Mwaisela, Mpoki, et autres
Publié: (2024)
par: Mwaisela, Mpoki, et autres
Publié: (2024)
The Hitchhiker's Guide to Programming and Optimizing Cache Coherent Heterogeneous Systems: CXL, NVLink-C2C, and AMD Infinity Fabric
par: Wang, Zixuan, et autres
Publié: (2024)
par: Wang, Zixuan, et autres
Publié: (2024)
Massimult: A Novel Parallel CPU Architecture Based on Combinator Reduction
par: Nicklisch-Franken, Jurgen, et autres
Publié: (2024)
par: Nicklisch-Franken, Jurgen, et autres
Publié: (2024)
ARCAS: Adaptive Runtime System for Chiplet-Aware Scheduling
par: Fogli, Alessandro, et autres
Publié: (2025)
par: Fogli, Alessandro, et autres
Publié: (2025)
TAPA: A Scalable Task-Parallel Dataflow Programming Framework for Modern FPGAs with Co-Optimization of HLS and Physical Design
par: Guo, Licheng, et autres
Publié: (2022)
par: Guo, Licheng, et autres
Publié: (2022)
Revisiting Disaggregated Large Language Model Serving for Performance and Energy Implications
par: Li, Jiaxi, et autres
Publié: (2025)
par: Li, Jiaxi, et autres
Publié: (2025)
Wattlytics: A Web Platform for Co-Optimizing Performance, Energy, and TCO in HPC Clusters
par: Afzal, Ayesha, et autres
Publié: (2026)
par: Afzal, Ayesha, et autres
Publié: (2026)
Random Adaptive Cache Placement Policy
par: Ahire, Vrushank, et autres
Publié: (2025)
par: Ahire, Vrushank, et autres
Publié: (2025)
GPT-OSS-20B: A Comprehensive Deployment-Centric Analysis of OpenAI's Open-Weight Mixture of Experts Model
par: Kumar, Deepak, et autres
Publié: (2025)
par: Kumar, Deepak, et autres
Publié: (2025)
Documents similaires
-
An Analytical Cost Model for Fast Evaluation of Multiple Compute-Engine CNN Accelerators
par: Qararyah, Fareed, et autres
Publié: (2025) -
Compiler Support for Speculation in Decoupled Access/Execute Architectures
par: Szafarczyk, Robert, et autres
Publié: (2025) -
EDEA: Efficient Dual-Engine Accelerator for Depthwise Separable Convolution with Direct Data Transfer
par: Chen, Yi, et autres
Publié: (2025) -
Optimizing Attention on GPUs by Exploiting GPU Architectural NUMA Effects
par: Choudhary, Mansi, et autres
Publié: (2025) -
Profiling Concurrent Vision Inference Workloads on NVIDIA Jetson -- Extended
par: Chakraborty, Abhinaba, et autres
Publié: (2025)