MMStencil: Optimizing High-order Stencils on Multicore CPU using Matrix Unit
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yinuo, Mao, Tianqi, Gan, Lin, Wan, Wubing, Song, Zeyu, Fu, Jiayu, He, Lanke, Wang, Wenqiang, Yin, Zekun, Xue, Wei, Yang, Guangwen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Stencil Matrixization
di: Zhao, Wenxuan, et al.
Pubblicazione: (2023)
di: Zhao, Wenxuan, et al.
Pubblicazione: (2023)
FastMPS: Revisit Data Parallel in Large-scale Matrix Product State Sampling
di: Chen, Yaojian, et al.
Pubblicazione: (2025)
di: Chen, Yaojian, et al.
Pubblicazione: (2025)
Persistent and Partitioned MPI for Stencil Communication
di: Collom, Gerald, et al.
Pubblicazione: (2025)
di: Collom, Gerald, et al.
Pubblicazione: (2025)
An Adaptive Distributed Stencil Abstraction for GPUs
di: Bhosale, Aditya, et al.
Pubblicazione: (2025)
di: Bhosale, Aditya, et al.
Pubblicazione: (2025)
Do We Need Tensor Cores for Stencil Computations?
di: Gu, Qiqi, et al.
Pubblicazione: (2026)
di: Gu, Qiqi, et al.
Pubblicazione: (2026)
To Repair or Not to Repair: Assessing Fault Resilience in MPI Stencil Applications
di: Rocco, Roberto, et al.
Pubblicazione: (2024)
di: Rocco, Roberto, et al.
Pubblicazione: (2024)
Unleashing Multicore Strength for Efficient Execution of Transactions
di: Ravish, Ankit, et al.
Pubblicazione: (2024)
di: Ravish, Ankit, et al.
Pubblicazione: (2024)
Towards Affordable, Adaptive and Automatic GNN Training on CPU-GPU Heterogeneous Platforms
di: Qiao, Tong, et al.
Pubblicazione: (2025)
di: Qiao, Tong, et al.
Pubblicazione: (2025)
Evaluation of Programming Models and Performance for Stencil Computation on Current GPU Architectures
di: Shan, Baodi, et al.
Pubblicazione: (2024)
di: Shan, Baodi, et al.
Pubblicazione: (2024)
A Portable Framework for Accelerating Stencil Computations on Modern Node Architectures
di: Sai, Ryuichi, et al.
Pubblicazione: (2023)
di: Sai, Ryuichi, et al.
Pubblicazione: (2023)
SPIDER: Unleashing Sparse Tensor Cores for Stencil Computation via Strided Swapping
di: GU, Qiqi, et al.
Pubblicazione: (2025)
di: GU, Qiqi, et al.
Pubblicazione: (2025)
Stencil Computations on Tenstorrent Wormhole
di: Piarulli, Lorenzo, et al.
Pubblicazione: (2026)
di: Piarulli, Lorenzo, et al.
Pubblicazione: (2026)
Matrix representation and GPU-optimized parallel B-spline computing
di: Wu, Jiayu, et al.
Pubblicazione: (2025)
di: Wu, Jiayu, et al.
Pubblicazione: (2025)
DGEMM on Integer Matrix Multiplication Unit
di: Ootomo, Hiroyuki, et al.
Pubblicazione: (2023)
di: Ootomo, Hiroyuki, et al.
Pubblicazione: (2023)
HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing
di: Lin, Mao, et al.
Pubblicazione: (2026)
di: Lin, Mao, et al.
Pubblicazione: (2026)
FTI-TMR: A Fault Tolerance and Isolation Algorithm for Interconnected Multicore Systems
di: Hu, Yiming
Pubblicazione: (2025)
di: Hu, Yiming
Pubblicazione: (2025)
Towards CXL Resilience to CPU Failures
di: Psistakis, Antonis, et al.
Pubblicazione: (2026)
di: Psistakis, Antonis, et al.
Pubblicazione: (2026)
Dual-pronged deep learning preprocessing on heterogeneous platforms with CPU, Accelerator and CSD
di: Wei, Jia, et al.
Pubblicazione: (2024)
di: Wei, Jia, et al.
Pubblicazione: (2024)
General-Purpose Multicore Architectures
di: Ghose, Saugata
Pubblicazione: (2024)
di: Ghose, Saugata
Pubblicazione: (2024)
Performance Enhancement of the Ozaki Scheme on Integer Matrix Multiplication Unit
di: Uchino, Yuki, et al.
Pubblicazione: (2024)
di: Uchino, Yuki, et al.
Pubblicazione: (2024)
Cyclic Data Streaming on GPUs for Short Range Stencils Applied to Molecular Dynamics
di: Rose, Martin, et al.
Pubblicazione: (2025)
di: Rose, Martin, et al.
Pubblicazione: (2025)
AcOrch: Accelerating Sampling-based GNN Training under CPU-NPU Heterogeneous Environments
di: Chen, Kefu, et al.
Pubblicazione: (2026)
di: Chen, Kefu, et al.
Pubblicazione: (2026)
WindVE: Collaborative CPU-NPU Vector Embedding
di: Huang, Jinqi, et al.
Pubblicazione: (2025)
di: Huang, Jinqi, et al.
Pubblicazione: (2025)
A Unified CPU-GPU Protocol for GNN Training
di: Lin, Yi-Chien, et al.
Pubblicazione: (2024)
di: Lin, Yi-Chien, et al.
Pubblicazione: (2024)
Combining GPU and CPU for accelerating evolutionary computing workloads
di: Eynaliyev, Rustam, et al.
Pubblicazione: (2025)
di: Eynaliyev, Rustam, et al.
Pubblicazione: (2025)
Pie: Pooling CPU Memory for LLM Inference
di: Xu, Yi, et al.
Pubblicazione: (2024)
di: Xu, Yi, et al.
Pubblicazione: (2024)
SW-TNC : Reaching the Most Complex Random Quantum Circuit via Tensor Network Contraction
di: Chen, Yaojian, et al.
Pubblicazione: (2025)
di: Chen, Yaojian, et al.
Pubblicazione: (2025)
TURNIP: A "Nondeterministic" GPU Runtime with CPU RAM Offload
di: Ding, Zhimin, et al.
Pubblicazione: (2024)
di: Ding, Zhimin, et al.
Pubblicazione: (2024)
CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference
di: Li, Suyi, et al.
Pubblicazione: (2024)
di: Li, Suyi, et al.
Pubblicazione: (2024)
Efficient Column-Wise N:M Pruning on RISC-V CPU
di: Chu, Chi-Wei, et al.
Pubblicazione: (2025)
di: Chu, Chi-Wei, et al.
Pubblicazione: (2025)
A Unified Programming Model for Heterogeneous Computing with CPU and Accelerator Technologies
di: Xiong, Yuqing
Pubblicazione: (2022)
di: Xiong, Yuqing
Pubblicazione: (2022)
Efficient Graph Embedding at Scale: Optimizing CPU-GPU-SSD Integration
di: Li, Zhonggen, et al.
Pubblicazione: (2025)
di: Li, Zhonggen, et al.
Pubblicazione: (2025)
Justin: Hybrid CPU/Memory Elastic Scaling for Distributed Stream Processing
di: Schmitz, Donatien, et al.
Pubblicazione: (2025)
di: Schmitz, Donatien, et al.
Pubblicazione: (2025)
HeteroSTA: A CPU-GPU Heterogeneous Static Timing Analysis Engine with Holistic Industrial Design Support
di: Guo, Zizheng, et al.
Pubblicazione: (2025)
di: Guo, Zizheng, et al.
Pubblicazione: (2025)
T-MAC: CPU Renaissance via Table Lookup for Low-Bit LLM Deployment on Edge
di: Wei, Jianyu, et al.
Pubblicazione: (2024)
di: Wei, Jianyu, et al.
Pubblicazione: (2024)
Performance characterisation of the 64-core SG2042 RISC-V CPU for HPC
di: Brown, Nick, et al.
Pubblicazione: (2024)
di: Brown, Nick, et al.
Pubblicazione: (2024)
Taming GPU Underutilization via Static Partitioning and Fine-grained CPU Offloading
di: Schieffer, Gabin, et al.
Pubblicazione: (2026)
di: Schieffer, Gabin, et al.
Pubblicazione: (2026)
A Study of Performance Programming of CPU, GPU accelerated Computers and SIMD Architecture
di: Yi, Xinyao
Pubblicazione: (2024)
di: Yi, Xinyao
Pubblicazione: (2024)
Temporal Load Imbalance on Ondes3D Seismic Simulator for Different Multicore Architectures
di: Solórzano, Ana Luisa Veroneze, et al.
Pubblicazione: (2024)
di: Solórzano, Ana Luisa Veroneze, et al.
Pubblicazione: (2024)
APEX: Asynchronous Parallel CPU-GPU Execution for Online LLM Inference on Constrained GPUs
di: Fan, Jiakun, et al.
Pubblicazione: (2025)
di: Fan, Jiakun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Stencil Matrixization
di: Zhao, Wenxuan, et al.
Pubblicazione: (2023) -
FastMPS: Revisit Data Parallel in Large-scale Matrix Product State Sampling
di: Chen, Yaojian, et al.
Pubblicazione: (2025) -
Persistent and Partitioned MPI for Stencil Communication
di: Collom, Gerald, et al.
Pubblicazione: (2025) -
An Adaptive Distributed Stencil Abstraction for GPUs
di: Bhosale, Aditya, et al.
Pubblicazione: (2025) -
Do We Need Tensor Cores for Stencil Computations?
di: Gu, Qiqi, et al.
Pubblicazione: (2026)