Kitsune: Enabling Dataflow Execution on GPUs
Fuente:
arXiv
Salvato in:
| Autori principali: | Davies, Michael, Crago, Neal, Sankaralingam, Karthikeyan, Keckler, Stephen W. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Lit Silicon: A Case Where Thermal Imbalance Couples Concurrent Execution in Multiple GPUs
di: Kurzynski, Marco, et al.
Pubblicazione: (2025)
di: Kurzynski, Marco, et al.
Pubblicazione: (2025)
COMET: A Framework for Modeling Compound Operation Dataflows with Explicit Collectives
di: Negi, Shubham, et al.
Pubblicazione: (2025)
di: Negi, Shubham, et al.
Pubblicazione: (2025)
CMDS: Cross-layer Dataflow Optimization for DNN Accelerators Exploiting Multi-bank Memories
di: Shi, Man, et al.
Pubblicazione: (2024)
di: Shi, Man, et al.
Pubblicazione: (2024)
MVDRAM: Enabling GeMV Execution in Unmodified DRAM for Low-Bit LLM Acceleration
di: Kubo, Tatsuya, et al.
Pubblicazione: (2025)
di: Kubo, Tatsuya, et al.
Pubblicazione: (2025)
HetGPU: The pursuit of making binary compatibility towards GPUs
di: Yang, Yiwei, et al.
Pubblicazione: (2025)
di: Yang, Yiwei, et al.
Pubblicazione: (2025)
Accelerating MoE with Dynamic In-Switch Computing on Multi-GPUs
di: Zhang, Qijun, et al.
Pubblicazione: (2026)
di: Zhang, Qijun, et al.
Pubblicazione: (2026)
GreenLLM: Disaggregating Large Language Model Serving on Heterogeneous GPUs for Lower Carbon Emissions
di: Shi, Tianyao, et al.
Pubblicazione: (2024)
di: Shi, Tianyao, et al.
Pubblicazione: (2024)
Exploration of Cryptocurrency Mining-Specific GPUs in AI Applications: A Case Study of CMP 170HX
di: Kangwei, Xing
Pubblicazione: (2025)
di: Kangwei, Xing
Pubblicazione: (2025)
Execution-Centric Characterization of FP8 Matrix Cores, Asynchronous Execution, and Structured Sparsity on AMD MI300A
di: Jarmusch, Aaron, et al.
Pubblicazione: (2026)
di: Jarmusch, Aaron, et al.
Pubblicazione: (2026)
Achieving Dependability of AI Execution with Radiation Hardened Processors
di: Taquichiri, Carlos Rafael Tordoya, et al.
Pubblicazione: (2025)
di: Taquichiri, Carlos Rafael Tordoya, et al.
Pubblicazione: (2025)
Data-aware Dynamic Execution of Irregular Workloads on Heterogeneous Systems
di: Bai, Zhenyu, et al.
Pubblicazione: (2025)
di: Bai, Zhenyu, et al.
Pubblicazione: (2025)
Fusing Depthwise and Pointwise Convolutions for Efficient Inference on GPUs
di: Qararyah, Fareed, et al.
Pubblicazione: (2024)
di: Qararyah, Fareed, et al.
Pubblicazione: (2024)
SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators
di: Li, Jonathan, et al.
Pubblicazione: (2025)
di: Li, Jonathan, et al.
Pubblicazione: (2025)
ZipFlow: a Compiler-based Framework to Unleash Compressed Data Movement for Modern GPUs
di: Yeo, Gwangoo, et al.
Pubblicazione: (2026)
di: Yeo, Gwangoo, et al.
Pubblicazione: (2026)
Accelerating Recommender Model ETL with a Streaming FPGA-GPU Dataflow
di: Zhu, Yu, et al.
Pubblicazione: (2025)
di: Zhu, Yu, et al.
Pubblicazione: (2025)
Enabling Mixed criticality applications for the Versal AI-Engines
di: Sprave, Vincent, et al.
Pubblicazione: (2026)
di: Sprave, Vincent, et al.
Pubblicazione: (2026)
EPOCH: Enabling Preemption Operation for Context Saving in Heterogeneous FPGA Systems
di: Malik, Arsalan Ali, et al.
Pubblicazione: (2025)
di: Malik, Arsalan Ali, et al.
Pubblicazione: (2025)
TAPA-CS: Enabling Scalable Accelerator Design on Distributed HBM-FPGAs
di: Prakriya, Neha, et al.
Pubblicazione: (2023)
di: Prakriya, Neha, et al.
Pubblicazione: (2023)
Enabling Time-Aware Priority Traffic Management over Distributed FPGA Nodes
di: Scionti, Alberto, et al.
Pubblicazione: (2025)
di: Scionti, Alberto, et al.
Pubblicazione: (2025)
FlexStep: Enabling Flexible Error Detection in Multi/Many-core Real-time Systems
di: Wang, Tinglue, et al.
Pubblicazione: (2025)
di: Wang, Tinglue, et al.
Pubblicazione: (2025)
Compiler Support for Speculation in Decoupled Access/Execute Architectures
di: Szafarczyk, Robert, et al.
Pubblicazione: (2025)
di: Szafarczyk, Robert, et al.
Pubblicazione: (2025)
Cloud-Native Operation of Roadside Infrastructure Enabling Demand-Driven Collective Perception via V2X
di: Zanger, Lukas, et al.
Pubblicazione: (2026)
di: Zanger, Lukas, et al.
Pubblicazione: (2026)
Proteus: Enabling High-Performance Processing-Using-DRAM with Dynamic Bit-Precision, Adaptive Data Representation, and Flexible Arithmetic
di: Oliveira, Geraldo F., et al.
Pubblicazione: (2025)
di: Oliveira, Geraldo F., et al.
Pubblicazione: (2025)
DeFiNES: Enabling Fast Exploration of the Depth-first Scheduling Space for DNN Accelerators through Analytical Modeling
di: Mei, Linyan, et al.
Pubblicazione: (2022)
di: Mei, Linyan, et al.
Pubblicazione: (2022)
EdgeReasoning: Characterizing Reasoning LLM Deployment on Edge GPUs
di: Kubwimana, Benjamin, et al.
Pubblicazione: (2025)
di: Kubwimana, Benjamin, et al.
Pubblicazione: (2025)
INR-Arch: A Dataflow Architecture and Compiler for Arbitrary-Order Gradient Computations in Implicit Neural Representation Processing
di: Abi-Karam, Stefan, et al.
Pubblicazione: (2023)
di: Abi-Karam, Stefan, et al.
Pubblicazione: (2023)
Hierarchical Resource Partitioning on Modern GPUs: A Reinforcement Learning Approach
di: Saroliya, Urvij, et al.
Pubblicazione: (2024)
di: Saroliya, Urvij, et al.
Pubblicazione: (2024)
HARP: A Taxonomy for Heterogeneous and Hierarchical Processors for Mixed-reuse Workloads
di: Garg, Raveesh, et al.
Pubblicazione: (2025)
di: Garg, Raveesh, et al.
Pubblicazione: (2025)
CELLO: Co-designing Schedule and Hybrid Implicit/Explicit Buffer for Complex Tensor Reuse
di: Garg, Raveesh, et al.
Pubblicazione: (2023)
di: Garg, Raveesh, et al.
Pubblicazione: (2023)
Exploring the Efficiency of 3D-Stacked AI Chip Architecture for LLM Inference with Voxel
di: Liu, Yiqi, et al.
Pubblicazione: (2026)
di: Liu, Yiqi, et al.
Pubblicazione: (2026)
Good things come in small packages: Should we build AI clusters with Lite-GPUs?
di: Canakci, Burcu, et al.
Pubblicazione: (2025)
di: Canakci, Burcu, et al.
Pubblicazione: (2025)
Efficient Hardware Accelerator Based on Medium Granularity Dataflow for SpTRSV
di: Chen, Qian, et al.
Pubblicazione: (2024)
di: Chen, Qian, et al.
Pubblicazione: (2024)
Fine-Grained Power and Energy Attribution on AMD GPU/APU-Based Exascale Nodes
di: McDaniel, Adam, et al.
Pubblicazione: (2026)
di: McDaniel, Adam, et al.
Pubblicazione: (2026)
iHAC: A Hybrid Cluster Architecture for Enhanced Performance and Resilience
di: Muntaka, Siddique Abubakr, et al.
Pubblicazione: (2026)
di: Muntaka, Siddique Abubakr, et al.
Pubblicazione: (2026)
NeuroRing: Scaling Spiking Neural Networks via Multi-FPGA Bidirectional Ring Topologies and Stream-Dataflow Architectures
di: Hafiz, Muhammad Ihsan Al, et al.
Pubblicazione: (2026)
di: Hafiz, Muhammad Ihsan Al, et al.
Pubblicazione: (2026)
A Reliable, Time-Predictable Heterogeneous SoC for AI-Enhanced Mixed-Criticality Edge Applications
di: Garofalo, Angelo, et al.
Pubblicazione: (2025)
di: Garofalo, Angelo, et al.
Pubblicazione: (2025)
From GPUs to RRAMs: Distributed In-Memory Primal-Dual Hybrid Gradient Method for Solving Large-Scale Linear Optimization Problem
di: Vo, Huynh Q. N., et al.
Pubblicazione: (2025)
di: Vo, Huynh Q. N., et al.
Pubblicazione: (2025)
Application Experiences on a GPU-Accelerated Arm-based HPC Testbed
di: Elwasif, Wael, et al.
Pubblicazione: (2022)
di: Elwasif, Wael, et al.
Pubblicazione: (2022)
ZKProphet: Understanding Performance of Zero-Knowledge Proofs on GPUs
di: Verma, Tarunesh, et al.
Pubblicazione: (2025)
di: Verma, Tarunesh, et al.
Pubblicazione: (2025)
Performance Analysis of HPC applications on the Aurora Supercomputer: Exploring the Impact of HBM-Enabled Intel Xeon Max CPUs
di: Ibeid, Huda, et al.
Pubblicazione: (2025)
di: Ibeid, Huda, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Lit Silicon: A Case Where Thermal Imbalance Couples Concurrent Execution in Multiple GPUs
di: Kurzynski, Marco, et al.
Pubblicazione: (2025) -
COMET: A Framework for Modeling Compound Operation Dataflows with Explicit Collectives
di: Negi, Shubham, et al.
Pubblicazione: (2025) -
CMDS: Cross-layer Dataflow Optimization for DNN Accelerators Exploiting Multi-bank Memories
di: Shi, Man, et al.
Pubblicazione: (2024) -
MVDRAM: Enabling GeMV Execution in Unmodified DRAM for Low-Bit LLM Acceleration
di: Kubo, Tatsuya, et al.
Pubblicazione: (2025) -
HetGPU: The pursuit of making binary compatibility towards GPUs
di: Yang, Yiwei, et al.
Pubblicazione: (2025)