Evaluating Emerging AI/ML Accelerators: IPU, RDU, and NVIDIA/AMD GPUs
Fuente:
arXiv
Salvato in:
| Autori principali: | Peng, Hongwu, Ding, Caiwen, Geng, Tong, Choudhury, Sutanay, Barker, Kevin, Li, Ang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Profiling Concurrent Vision Inference Workloads on NVIDIA Jetson -- Extended
di: Chakraborty, Abhinaba, et al.
Pubblicazione: (2025)
di: Chakraborty, Abhinaba, et al.
Pubblicazione: (2025)
Dissecting the NVIDIA Hopper Architecture through Microbenchmarking and Multiple Level Analysis
di: Luo, Weile, et al.
Pubblicazione: (2025)
di: Luo, Weile, et al.
Pubblicazione: (2025)
Fusing Depthwise and Pointwise Convolutions for Efficient Inference on GPUs
di: Qararyah, Fareed, et al.
Pubblicazione: (2024)
di: Qararyah, Fareed, et al.
Pubblicazione: (2024)
ZKProphet: Understanding Performance of Zero-Knowledge Proofs on GPUs
di: Verma, Tarunesh, et al.
Pubblicazione: (2025)
di: Verma, Tarunesh, et al.
Pubblicazione: (2025)
Optimizing Attention on GPUs by Exploiting GPU Architectural NUMA Effects
di: Choudhary, Mansi, et al.
Pubblicazione: (2025)
di: Choudhary, Mansi, et al.
Pubblicazione: (2025)
The Hitchhiker's Guide to Programming and Optimizing Cache Coherent Heterogeneous Systems: CXL, NVLink-C2C, and AMD Infinity Fabric
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
SGDRC: Software-Defined Dynamic Resource Control for Concurrent DNN Inference on NVIDIA GPUs
di: Zhang, Yongkang, et al.
Pubblicazione: (2024)
di: Zhang, Yongkang, et al.
Pubblicazione: (2024)
RedFuser: An Automatic Operator Fusion Framework for Cascaded Reductions on AI Accelerators
di: Tang, Xinsheng, et al.
Pubblicazione: (2026)
di: Tang, Xinsheng, et al.
Pubblicazione: (2026)
GigaAPI for GPU Parallelization
di: Suvarna, M., et al.
Pubblicazione: (2025)
di: Suvarna, M., et al.
Pubblicazione: (2025)
Performance Analysis of HPC applications on the Aurora Supercomputer: Exploring the Impact of HBM-Enabled Intel Xeon Max CPUs
di: Ibeid, Huda, et al.
Pubblicazione: (2025)
di: Ibeid, Huda, et al.
Pubblicazione: (2025)
UPMEM Unleashed: Software Secrets for Speed
di: Chmielewski, Krystian, et al.
Pubblicazione: (2025)
di: Chmielewski, Krystian, et al.
Pubblicazione: (2025)
Experimental Assessment of Containers Running on Top of Virtual Machines
di: Aqasizade, Hossein, et al.
Pubblicazione: (2024)
di: Aqasizade, Hossein, et al.
Pubblicazione: (2024)
Compiler Support for Speculation in Decoupled Access/Execute Architectures
di: Szafarczyk, Robert, et al.
Pubblicazione: (2025)
di: Szafarczyk, Robert, et al.
Pubblicazione: (2025)
Exploring and Evaluating Real-world CXL: Use Cases and System Adoption
di: Wang, Xi, et al.
Pubblicazione: (2024)
di: Wang, Xi, et al.
Pubblicazione: (2024)
Parallelizing a modern GPU simulator
di: Huerta, Rodrigo, et al.
Pubblicazione: (2025)
di: Huerta, Rodrigo, et al.
Pubblicazione: (2025)
Can Asymmetric Tile Buffering Be Beneficial?
di: Wang, Chengyue, et al.
Pubblicazione: (2025)
di: Wang, Chengyue, et al.
Pubblicazione: (2025)
Exploiting long vectors with a CFD code: a co-design show case
di: Blancafort, Marc, et al.
Pubblicazione: (2024)
di: Blancafort, Marc, et al.
Pubblicazione: (2024)
Simopt -- Simulation pass for Speculative Optimisation of FPGA-CAD flow
di: Wadhwa, Eashan, et al.
Pubblicazione: (2024)
di: Wadhwa, Eashan, et al.
Pubblicazione: (2024)
The Energy Blind Spot: NVIDIA's Flagship Edge AI Hardware Cannot Support Process-Level Energy Attribution
di: Panigrahy, Deepak, et al.
Pubblicazione: (2026)
di: Panigrahy, Deepak, et al.
Pubblicazione: (2026)
Sustainable AI Training via Hardware-Software Co-Design on NVIDIA, AMD, and Emerging GPU Architectures
di: Makin, Yashasvi, et al.
Pubblicazione: (2025)
di: Makin, Yashasvi, et al.
Pubblicazione: (2025)
Evaluating the Potential of In-Memory Processing to Accelerate Homomorphic Encryption
di: Mwaisela, Mpoki, et al.
Pubblicazione: (2024)
di: Mwaisela, Mpoki, et al.
Pubblicazione: (2024)
Efficient Hardware Accelerator Based on Medium Granularity Dataflow for SpTRSV
di: Chen, Qian, et al.
Pubblicazione: (2024)
di: Chen, Qian, et al.
Pubblicazione: (2024)
Cloud to Edge: Benchmarking LLM Inference On Hardware-Accelerated Single-Board Computers
di: Renney, Harri, et al.
Pubblicazione: (2026)
di: Renney, Harri, et al.
Pubblicazione: (2026)
Accelerating MoE with Dynamic In-Switch Computing on Multi-GPUs
di: Zhang, Qijun, et al.
Pubblicazione: (2026)
di: Zhang, Qijun, et al.
Pubblicazione: (2026)
Vector-Centric Machine Learning Systems: A Cross-Stack Approach
di: Jiang, Wenqi
Pubblicazione: (2025)
di: Jiang, Wenqi
Pubblicazione: (2025)
HetGPU: The pursuit of making binary compatibility towards GPUs
di: Yang, Yiwei, et al.
Pubblicazione: (2025)
di: Yang, Yiwei, et al.
Pubblicazione: (2025)
GPT-OSS-20B: A Comprehensive Deployment-Centric Analysis of OpenAI's Open-Weight Mixture of Experts Model
di: Kumar, Deepak, et al.
Pubblicazione: (2025)
di: Kumar, Deepak, et al.
Pubblicazione: (2025)
Performance and Power: Systematic Evaluation of AI Workloads on Accelerators with CARAML
di: John, Chelsea Maria, et al.
Pubblicazione: (2024)
di: John, Chelsea Maria, et al.
Pubblicazione: (2024)
GreenLLM: Disaggregating Large Language Model Serving on Heterogeneous GPUs for Lower Carbon Emissions
di: Shi, Tianyao, et al.
Pubblicazione: (2024)
di: Shi, Tianyao, et al.
Pubblicazione: (2024)
DABench-LLM: Standardized and In-Depth Benchmarking of Post-Moore Dataflow AI Accelerators for LLMs
di: Hu, Ziyu, et al.
Pubblicazione: (2025)
di: Hu, Ziyu, et al.
Pubblicazione: (2025)
SCAR: Scheduling Multi-Model AI Workloads on Heterogeneous Multi-Chiplet Module Accelerators
di: Odema, Mohanad, et al.
Pubblicazione: (2024)
di: Odema, Mohanad, et al.
Pubblicazione: (2024)
Kitsune: Enabling Dataflow Execution on GPUs
di: Davies, Michael, et al.
Pubblicazione: (2025)
di: Davies, Michael, et al.
Pubblicazione: (2025)
Exploration of Cryptocurrency Mining-Specific GPUs in AI Applications: A Case Study of CMP 170HX
di: Kangwei, Xing
Pubblicazione: (2025)
di: Kangwei, Xing
Pubblicazione: (2025)
ARKV: Adaptive and Resource-Efficient KV Cache Management under Limited Memory Budget for Long-Context Inference in LLMs
di: Lei, Jianlong, et al.
Pubblicazione: (2026)
di: Lei, Jianlong, et al.
Pubblicazione: (2026)
PyGim: An Efficient Graph Neural Network Library for Real Processing-In-Memory Architectures
di: Giannoula, Christina, et al.
Pubblicazione: (2024)
di: Giannoula, Christina, et al.
Pubblicazione: (2024)
Spira: Exploiting Voxel Data Structural Properties for Efficient Sparse Convolution in Point Cloud Networks
di: Adamopoulos, Dionysios, et al.
Pubblicazione: (2025)
di: Adamopoulos, Dionysios, et al.
Pubblicazione: (2025)
DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures
di: Yang, Peiming, et al.
Pubblicazione: (2025)
di: Yang, Peiming, et al.
Pubblicazione: (2025)
Characterizing and Optimizing LLM Inference Workloads on CPU-GPU Coupled Architectures
di: Vellaisamy, Prabhu, et al.
Pubblicazione: (2025)
di: Vellaisamy, Prabhu, et al.
Pubblicazione: (2025)
ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression
di: Fan, Ruibo, et al.
Pubblicazione: (2026)
di: Fan, Ruibo, et al.
Pubblicazione: (2026)
ARCAS: Adaptive Runtime System for Chiplet-Aware Scheduling
di: Fogli, Alessandro, et al.
Pubblicazione: (2025)
di: Fogli, Alessandro, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Profiling Concurrent Vision Inference Workloads on NVIDIA Jetson -- Extended
di: Chakraborty, Abhinaba, et al.
Pubblicazione: (2025) -
Dissecting the NVIDIA Hopper Architecture through Microbenchmarking and Multiple Level Analysis
di: Luo, Weile, et al.
Pubblicazione: (2025) -
Fusing Depthwise and Pointwise Convolutions for Efficient Inference on GPUs
di: Qararyah, Fareed, et al.
Pubblicazione: (2024) -
ZKProphet: Understanding Performance of Zero-Knowledge Proofs on GPUs
di: Verma, Tarunesh, et al.
Pubblicazione: (2025) -
Optimizing Attention on GPUs by Exploiting GPU Architectural NUMA Effects
di: Choudhary, Mansi, et al.
Pubblicazione: (2025)