cuConv: A CUDA Implementation of Convolution for CNN Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | Jordà, Marc, Valero-Lara, Pedro, Peña, Antonio J. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2021
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Split CNN Inference on Networked Microcontrollers
di: Lu, Junyu, et al.
Pubblicazione: (2026)
di: Lu, Junyu, et al.
Pubblicazione: (2026)
cuVegas: Accelerate Multidimensional Monte Carlo Integration through a Parallelized CUDA-based Implementation of the VEGAS Enhanced Algorithm
di: Tolotti, Emiliano, et al.
Pubblicazione: (2024)
di: Tolotti, Emiliano, et al.
Pubblicazione: (2024)
Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start
di: Liu, Xueshen, et al.
Pubblicazione: (2026)
di: Liu, Xueshen, et al.
Pubblicazione: (2026)
CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning
di: Li, Xiaoya, et al.
Pubblicazione: (2025)
di: Li, Xiaoya, et al.
Pubblicazione: (2025)
Adaptive Resolution Inference (ARI): Energy-Efficient Machine Learning for Internet of Things
di: Wang, Ziheng, et al.
Pubblicazione: (2024)
di: Wang, Ziheng, et al.
Pubblicazione: (2024)
Weather Prediction Using CNN-LSTM for Time Series Analysis: A Case Study on Delhi Temperature Data
di: Li, Bangyu, et al.
Pubblicazione: (2024)
di: Li, Bangyu, et al.
Pubblicazione: (2024)
Heterogeneous Federated Learning with Convolutional and Spiking Neural Networks
di: Yu, Yingchao, et al.
Pubblicazione: (2024)
di: Yu, Yingchao, et al.
Pubblicazione: (2024)
FL-APU: A Software Architecture to Ease Practical Implementation of Cross-Silo Federated Learning
di: Stricker, F., et al.
Pubblicazione: (2025)
di: Stricker, F., et al.
Pubblicazione: (2025)
Scattered Mixture-of-Experts Implementation
di: Tan, Shawn, et al.
Pubblicazione: (2024)
di: Tan, Shawn, et al.
Pubblicazione: (2024)
Collaborative Speculative Inference for Efficient LLM Inference Serving
di: Gao, Luyao, et al.
Pubblicazione: (2025)
di: Gao, Luyao, et al.
Pubblicazione: (2025)
Accelerating Depthwise Separable Convolutions on Ultra-Low-Power Devices
di: Daghero, Francesco, et al.
Pubblicazione: (2024)
di: Daghero, Francesco, et al.
Pubblicazione: (2024)
Distributed Convolutional Neural Network Training on Mobile and Edge Clusters
di: Rama, Pranav, et al.
Pubblicazione: (2024)
di: Rama, Pranav, et al.
Pubblicazione: (2024)
Efficient Distributed Learning over Decentralized Networks with Convoluted Support Vector Machine
di: Chen, Canyi, et al.
Pubblicazione: (2025)
di: Chen, Canyi, et al.
Pubblicazione: (2025)
Where Do the Joules Go? Diagnosing Inference Energy Consumption
di: Chung, Jae-Won, et al.
Pubblicazione: (2026)
di: Chung, Jae-Won, et al.
Pubblicazione: (2026)
A Survey on Collaborative DNN Inference for Edge Intelligence
di: Ren, Weiqing, et al.
Pubblicazione: (2022)
di: Ren, Weiqing, et al.
Pubblicazione: (2022)
Salted Inference: Enhancing Privacy while Maintaining Efficiency of Split Inference in Mobile Computing
di: Malekzadeh, Mohammad, et al.
Pubblicazione: (2023)
di: Malekzadeh, Mohammad, et al.
Pubblicazione: (2023)
Accelerate Intermittent Deep Inference
di: Zhang, Ziliang
Pubblicazione: (2024)
di: Zhang, Ziliang
Pubblicazione: (2024)
Inference economics of language models
di: Erdil, Ege
Pubblicazione: (2025)
di: Erdil, Ege
Pubblicazione: (2025)
Arctic Inference with Shift Parallelism: Fast and Efficient Open Source Inference System for Enterprise AI
di: Rajbhandari, Samyam, et al.
Pubblicazione: (2025)
di: Rajbhandari, Samyam, et al.
Pubblicazione: (2025)
FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel
di: Yan, Ran, et al.
Pubblicazione: (2025)
di: Yan, Ran, et al.
Pubblicazione: (2025)
Designing Large Foundation Models for Efficient Training and Inference: A Survey
di: Liu, Dong, et al.
Pubblicazione: (2024)
di: Liu, Dong, et al.
Pubblicazione: (2024)
Practical Performance Guarantees for Pipelined DNN Inference
di: Archer, Aaron, et al.
Pubblicazione: (2023)
di: Archer, Aaron, et al.
Pubblicazione: (2023)
Pie: Pooling CPU Memory for LLM Inference
di: Xu, Yi, et al.
Pubblicazione: (2024)
di: Xu, Yi, et al.
Pubblicazione: (2024)
STAR: Decode-Phase Rescheduling for LLM Inference
di: Wang, Zhibin, et al.
Pubblicazione: (2025)
di: Wang, Zhibin, et al.
Pubblicazione: (2025)
HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference
di: Tang, Peng, et al.
Pubblicazione: (2024)
di: Tang, Peng, et al.
Pubblicazione: (2024)
Fast Distributed Inference Serving for Large Language Models
di: Wu, Bingyang, et al.
Pubblicazione: (2023)
di: Wu, Bingyang, et al.
Pubblicazione: (2023)
Priority-Aware Model-Distributed Inference at Edge Networks
di: Li, Teng, et al.
Pubblicazione: (2024)
di: Li, Teng, et al.
Pubblicazione: (2024)
CascadeServe: Unlocking Model Cascades for Inference Serving
di: Kossmann, Ferdi, et al.
Pubblicazione: (2024)
di: Kossmann, Ferdi, et al.
Pubblicazione: (2024)
Optimal Scheduling Algorithms for LLM Inference: Theory and Practice
di: Bari, Agrim, et al.
Pubblicazione: (2025)
di: Bari, Agrim, et al.
Pubblicazione: (2025)
Dynamic Rebatching for Efficient Early-Exit Inference with DREX
di: Liu, Xuting, et al.
Pubblicazione: (2025)
di: Liu, Xuting, et al.
Pubblicazione: (2025)
Design and Implementation of an Automated Disaster-recovery System for a Kubernetes Cluster Using LSTM
di: Kim, Ji-Beom, et al.
Pubblicazione: (2024)
di: Kim, Ji-Beom, et al.
Pubblicazione: (2024)
DALI: A Workload-Aware Offloading Framework for Efficient MoE Inference on Local PCs
di: Zhu, Zeyu, et al.
Pubblicazione: (2026)
di: Zhu, Zeyu, et al.
Pubblicazione: (2026)
SERFLOW: A Cross-Service Cost Optimization Framework for SLO-Aware Dynamic ML Inference
di: Zhang, Zongshun, et al.
Pubblicazione: (2025)
di: Zhang, Zongshun, et al.
Pubblicazione: (2025)
MultiTASC++: A Continuously Adaptive Scheduler for Edge-Based Multi-Device Cascade Inference
di: Nikolaidis, Sokratis, et al.
Pubblicazione: (2024)
di: Nikolaidis, Sokratis, et al.
Pubblicazione: (2024)
Making MoE-based LLM Inference Resilient with Tarragon
di: Zhang, Songyu, et al.
Pubblicazione: (2026)
di: Zhang, Songyu, et al.
Pubblicazione: (2026)
Intelligent Orchestration of Distributed Large Foundation Model Inference at the Edge
di: Koch, Fernando, et al.
Pubblicazione: (2025)
di: Koch, Fernando, et al.
Pubblicazione: (2025)
AntBatchInfer: Elastic Batch Inference in the Kubernetes Cluster
di: Li, Siyuan, et al.
Pubblicazione: (2024)
di: Li, Siyuan, et al.
Pubblicazione: (2024)
ExeGPT: Constraint-Aware Resource Scheduling for LLM Inference
di: Oh, Hyungjun, et al.
Pubblicazione: (2024)
di: Oh, Hyungjun, et al.
Pubblicazione: (2024)
Floe: Federated Specialization for Real-Time LLM-SLM Inference
di: Tian, Chunlin, et al.
Pubblicazione: (2026)
di: Tian, Chunlin, et al.
Pubblicazione: (2026)
Understanding and Improving Communication Performance in Multi-node LLM Inference
di: Singhania, Prajwal, et al.
Pubblicazione: (2025)
di: Singhania, Prajwal, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Split CNN Inference on Networked Microcontrollers
di: Lu, Junyu, et al.
Pubblicazione: (2026) -
cuVegas: Accelerate Multidimensional Monte Carlo Integration through a Parallelized CUDA-based Implementation of the VEGAS Enhanced Algorithm
di: Tolotti, Emiliano, et al.
Pubblicazione: (2024) -
Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start
di: Liu, Xueshen, et al.
Pubblicazione: (2026) -
CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning
di: Li, Xiaoya, et al.
Pubblicazione: (2025) -
Adaptive Resolution Inference (ARI): Energy-Efficient Machine Learning for Internet of Things
di: Wang, Ziheng, et al.
Pubblicazione: (2024)