SPIDER: Unleashing Sparse Tensor Cores for Stencil Computation via Strided Swapping
Fuente:
arXiv
Salvato in:
| Autori principali: | GU, Qiqi, Wu, Chenpeng, Shi, Heng, Yao, Jianguo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Do We Need Tensor Cores for Stencil Computations?
di: Gu, Qiqi, et al.
Pubblicazione: (2026)
di: Gu, Qiqi, et al.
Pubblicazione: (2026)
Samoyeds: Accelerating MoE Models with Structured Sparsity Leveraging Sparse Tensor Cores
di: Wu, Chenpeng, et al.
Pubblicazione: (2025)
di: Wu, Chenpeng, et al.
Pubblicazione: (2025)
Stencil Matrixization
di: Zhao, Wenxuan, et al.
Pubblicazione: (2023)
di: Zhao, Wenxuan, et al.
Pubblicazione: (2023)
Evaluation of Programming Models and Performance for Stencil Computation on Current GPU Architectures
di: Shan, Baodi, et al.
Pubblicazione: (2024)
di: Shan, Baodi, et al.
Pubblicazione: (2024)
A Portable Framework for Accelerating Stencil Computations on Modern Node Architectures
di: Sai, Ryuichi, et al.
Pubblicazione: (2023)
di: Sai, Ryuichi, et al.
Pubblicazione: (2023)
Stencil Computations on Tenstorrent Wormhole
di: Piarulli, Lorenzo, et al.
Pubblicazione: (2026)
di: Piarulli, Lorenzo, et al.
Pubblicazione: (2026)
Persistent and Partitioned MPI for Stencil Communication
di: Collom, Gerald, et al.
Pubblicazione: (2025)
di: Collom, Gerald, et al.
Pubblicazione: (2025)
An Adaptive Distributed Stencil Abstraction for GPUs
di: Bhosale, Aditya, et al.
Pubblicazione: (2025)
di: Bhosale, Aditya, et al.
Pubblicazione: (2025)
To Repair or Not to Repair: Assessing Fault Resilience in MPI Stencil Applications
di: Rocco, Roberto, et al.
Pubblicazione: (2024)
di: Rocco, Roberto, et al.
Pubblicazione: (2024)
High Performance Unstructured SpMM Computation Using Tensor Cores
di: Okanovic, Patrik, et al.
Pubblicazione: (2024)
di: Okanovic, Patrik, et al.
Pubblicazione: (2024)
HotSwap: Enabling Live Dependency Sharing in Serverless Computing
di: Li, Rui, et al.
Pubblicazione: (2024)
di: Li, Rui, et al.
Pubblicazione: (2024)
MMStencil: Optimizing High-order Stencils on Multicore CPU using Matrix Unit
di: Wang, Yinuo, et al.
Pubblicazione: (2025)
di: Wang, Yinuo, et al.
Pubblicazione: (2025)
ZeroPP: Unleashing Exceptional Parallelism Efficiency through Tensor-Parallelism-Free Methodology
di: Tang, Ding, et al.
Pubblicazione: (2024)
di: Tang, Ding, et al.
Pubblicazione: (2024)
cuFastTuckerPlus: A Stochastic Parallel Sparse FastTucker Decomposition Using GPU Tensor Cores
di: Li, Zixuan, et al.
Pubblicazione: (2024)
di: Li, Zixuan, et al.
Pubblicazione: (2024)
QPU Micro-Kernels for Stencil Computation
di: Markidis, Stefano, et al.
Pubblicazione: (2025)
di: Markidis, Stefano, et al.
Pubblicazione: (2025)
Generalized Compare and Swap
di: Hadzilacos, Vassos, et al.
Pubblicazione: (2024)
di: Hadzilacos, Vassos, et al.
Pubblicazione: (2024)
KUBEDIRECT: Unleashing the Full Power of the Cluster Manager for Serverless Computing
di: Qi, Sheng, et al.
Pubblicazione: (2026)
di: Qi, Sheng, et al.
Pubblicazione: (2026)
Fused3S: Fast Sparse Attention on Tensor Cores
di: Li, Zitong, et al.
Pubblicazione: (2025)
di: Li, Zitong, et al.
Pubblicazione: (2025)
Accelerating Sparse MTTKRP for Small Tensor Decomposition on GPU
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
Lagom: Unleashing the Power of Communication and Computation Overlapping for Distributed LLM Training
di: Xu, Guanbin, et al.
Pubblicazione: (2026)
di: Xu, Guanbin, et al.
Pubblicazione: (2026)
PRISM: Processing-In-Memory Sparse MTTKRP for Tensor Decomposition Acceleration
di: Pacheco, Daniel, et al.
Pubblicazione: (2026)
di: Pacheco, Daniel, et al.
Pubblicazione: (2026)
Cyclic Data Streaming on GPUs for Short Range Stencils Applied to Molecular Dynamics
di: Rose, Martin, et al.
Pubblicazione: (2025)
di: Rose, Martin, et al.
Pubblicazione: (2025)
Accelerating Drug Discovery in AutoDock-GPU with Tensor Cores
di: Schieffer, Gabin, et al.
Pubblicazione: (2024)
di: Schieffer, Gabin, et al.
Pubblicazione: (2024)
Unleashing Collaborative Computing for Adaptive Video Streaming with Multi-objective Optimization in Satellite Terrestrial Networks
di: Shen, Zhishu, et al.
Pubblicazione: (2024)
di: Shen, Zhishu, et al.
Pubblicazione: (2024)
AMPED: Accelerating MTTKRP for Billion-Scale Sparse Tensor Decomposition on Multiple GPUs
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
PeerSwap: A Peer-Sampler with Randomness Guarantees
di: Guerraoui, Rachid, et al.
Pubblicazione: (2024)
di: Guerraoui, Rachid, et al.
Pubblicazione: (2024)
ARM SVE Unleashed: Performance and Insights Across HPC Applications on Nvidia Grace
di: Shi, Ruimin, et al.
Pubblicazione: (2025)
di: Shi, Ruimin, et al.
Pubblicazione: (2025)
Unleashing Scalable Context Parallelism for Foundation Models Pre-Training via FCP
di: Zhao, Yilong, et al.
Pubblicazione: (2026)
di: Zhao, Yilong, et al.
Pubblicazione: (2026)
Unleashing Efficient Asynchronous RL Post-Training via Staleness-Constrained Rollout Coordination
di: Li, Haoyang, et al.
Pubblicazione: (2026)
di: Li, Haoyang, et al.
Pubblicazione: (2026)
FlashFuser: Expanding the Scale of Kernel Fusion for Compute-Intensive Operators via Inter-Core Connection
di: Huang, Ziyu, et al.
Pubblicazione: (2025)
di: Huang, Ziyu, et al.
Pubblicazione: (2025)
Unleashing Multicore Strength for Efficient Execution of Transactions
di: Ravish, Ankit, et al.
Pubblicazione: (2024)
di: Ravish, Ankit, et al.
Pubblicazione: (2024)
Predictive Performance of Photonic SRAM-based In-Memory Computing for Tensor Decomposition
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
Minimizing Communication for Parallel Symmetric Tensor Times Same Vector Computation
di: Daas, Hussam Al, et al.
Pubblicazione: (2025)
di: Daas, Hussam Al, et al.
Pubblicazione: (2025)
Stencil Computations on Cerebras Wafer-Scale Engine
di: Belli, Elia, et al.
Pubblicazione: (2026)
di: Belli, Elia, et al.
Pubblicazione: (2026)
Generalized Compare-and-Swap and Space-Efficient Universal Constructions for the Infinite-Arrival Model
di: Hadzilacos, Vassos, et al.
Pubblicazione: (2026)
di: Hadzilacos, Vassos, et al.
Pubblicazione: (2026)
Guaranteed DGEMM Accuracy While Using Reduced Precision Tensor Cores Through Extensions of the Ozaki Scheme
di: Schwarz, Angelika, et al.
Pubblicazione: (2025)
di: Schwarz, Angelika, et al.
Pubblicazione: (2025)
Can Tensor Cores Benefit Memory-Bound Kernels? (No!)
di: Zhang, Lingqi, et al.
Pubblicazione: (2025)
di: Zhang, Lingqi, et al.
Pubblicazione: (2025)
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
di: Li, Zhonggen, et al.
Pubblicazione: (2024)
di: Li, Zhonggen, et al.
Pubblicazione: (2024)
Unleashing the Power of Tree-of-Thoughts for Edge-Enabled AIGC Service Provisioning
di: Liu, Zhang, et al.
Pubblicazione: (2026)
di: Liu, Zhang, et al.
Pubblicazione: (2026)
Accelerating Heterogeneous Tensor Parallelism via Flexible Workload Control
di: Wang, Zhigang, et al.
Pubblicazione: (2024)
di: Wang, Zhigang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Do We Need Tensor Cores for Stencil Computations?
di: Gu, Qiqi, et al.
Pubblicazione: (2026) -
Samoyeds: Accelerating MoE Models with Structured Sparsity Leveraging Sparse Tensor Cores
di: Wu, Chenpeng, et al.
Pubblicazione: (2025) -
Stencil Matrixization
di: Zhao, Wenxuan, et al.
Pubblicazione: (2023) -
Evaluation of Programming Models and Performance for Stencil Computation on Current GPU Architectures
di: Shan, Baodi, et al.
Pubblicazione: (2024) -
A Portable Framework for Accelerating Stencil Computations on Modern Node Architectures
di: Sai, Ryuichi, et al.
Pubblicazione: (2023)