MERBIT: A GPU-Based SpMV Method for Iterative Workloads
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Qi, Yao, Zhengan, Jiang, Zhenglu, Zhang, Zan-Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CB-SpMV:A Data Aggregating and Balance Algorithm for Cache-Friendly Block-Based SpMV on GPUs
por: Cong, Xing, et al.
Publicado: (2026)
por: Cong, Xing, et al.
Publicado: (2026)
A Nonlinear Hash-based Optimization Method for SpMV on GPUs
por: Yan, Chen, et al.
Publicado: (2025)
por: Yan, Chen, et al.
Publicado: (2025)
Toward Efficient SpMV in Sparse LLMs via Block Extraction and Compressed Storage
por: Lin, Junqing, et al.
Publicado: (2025)
por: Lin, Junqing, et al.
Publicado: (2025)
Mat2Boundary: Treating User-Defined Boundary Condition as SpMV for Distributed PDE Solvers on Block-Structured Grids
por: Cai, Yanzheng, et al.
Publicado: (2026)
por: Cai, Yanzheng, et al.
Publicado: (2026)
CRIUgpu: Transparent Checkpointing of GPU-Accelerated Workloads
por: Stoyanov, Radostin, et al.
Publicado: (2025)
por: Stoyanov, Radostin, et al.
Publicado: (2025)
Beyond Microservices: Testing Web-Scale RCA Methods on GPU-Driven LLM Workloads
por: Scheinert, Dominik, et al.
Publicado: (2026)
por: Scheinert, Dominik, et al.
Publicado: (2026)
PRISM: Dynamic Primitive-Based Forecasting for Large-Scale GPU Cluster Workloads
por: Wu, Xin, et al.
Publicado: (2026)
por: Wu, Xin, et al.
Publicado: (2026)
Parallel GPU-Enabled Algorithms for SpGEMM on Arbitrary Semirings with Hybrid Communication
por: McFarland, Thomas, et al.
Publicado: (2025)
por: McFarland, Thomas, et al.
Publicado: (2025)
PAL: A Variability-Aware Policy for Scheduling ML Workloads in GPU Clusters
por: Jain, Rutwik, et al.
Publicado: (2024)
por: Jain, Rutwik, et al.
Publicado: (2024)
High-Performance N-Queens Solver on GPU: Iterative DFS with Zero Bank Conflicts
por: Yao, Guangchao, et al.
Publicado: (2025)
por: Yao, Guangchao, et al.
Publicado: (2025)
Characterizing Production GPU Workloads using System-wide Telemetry Data
por: Cankur, Onur, et al.
Publicado: (2025)
por: Cankur, Onur, et al.
Publicado: (2025)
Minos: Systematically Classifying Performance and Power Characteristics of GPU Workloads on HPC Clusters
por: Jain, Rutwik, et al.
Publicado: (2026)
por: Jain, Rutwik, et al.
Publicado: (2026)
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
por: Li, Zhonggen, et al.
Publicado: (2024)
por: Li, Zhonggen, et al.
Publicado: (2024)
An Online Fragmentation-Aware Scheduler for Managing GPU-Sharing Workloads on Multi-Instance GPUs
por: Ting, Hsu-Tzu, et al.
Publicado: (2025)
por: Ting, Hsu-Tzu, et al.
Publicado: (2025)
KIS-S: A GPU-Aware Kubernetes Inference Simulator with RL-Based Auto-Scaling
por: Zhang, Guilin, et al.
Publicado: (2025)
por: Zhang, Guilin, et al.
Publicado: (2025)
GPU-Based Parallel Computing Methods for Medical Photoacoustic Image Reconstruction
por: Yi, Xinyao, et al.
Publicado: (2024)
por: Yi, Xinyao, et al.
Publicado: (2024)
PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications
por: Du, Kuntai, et al.
Publicado: (2025)
por: Du, Kuntai, et al.
Publicado: (2025)
Accelerating Compound LLM Training Workloads with Maestro
por: Yuan, Xiulong, et al.
Publicado: (2026)
por: Yuan, Xiulong, et al.
Publicado: (2026)
Union: An Automatic Workload Manager for Accelerating Network Simulation
por: Wang, Xin, et al.
Publicado: (2024)
por: Wang, Xin, et al.
Publicado: (2024)
PICO: Accelerating All k-Core Paradigms on GPU
por: Zhao, Chen, et al.
Publicado: (2024)
por: Zhao, Chen, et al.
Publicado: (2024)
AES-SpMM: Balancing Accuracy and Speed by Adaptive Edge Sampling Strategy to Accelerate SpMM in GNNs
por: Song, Yingchen, et al.
Publicado: (2025)
por: Song, Yingchen, et al.
Publicado: (2025)
Communication-Avoiding SpGEMM via Trident Partitioning on Hierarchical GPU Interconnects
por: Bellavita, Julian, et al.
Publicado: (2026)
por: Bellavita, Julian, et al.
Publicado: (2026)
Distributed Load Balancing with Workload-Dependent Service Rates
por: Zhang, Wenxin, et al.
Publicado: (2024)
por: Zhang, Wenxin, et al.
Publicado: (2024)
AAPA: An Archetype-Aware Predictive Autoscaler with Uncertainty Quantification for Serverless Workloads on Kubernetes
por: Zhang, Guilin, et al.
Publicado: (2025)
por: Zhang, Guilin, et al.
Publicado: (2025)
Towards Cloud Efficiency with Large-scale Workload Characterization
por: Parayil, Anjaly, et al.
Publicado: (2024)
por: Parayil, Anjaly, et al.
Publicado: (2024)
ParamSpMM: Adaptive and Efficient Sparse Matrix-Matrix Multiplication on GPUs for GNNs
por: Zhang, Lixing, et al.
Publicado: (2026)
por: Zhang, Lixing, et al.
Publicado: (2026)
Workload Distribution with Rateless Encoding: A Low-Latency Computation Offloading Method within Edge Networks
por: Guo, Zhongfu, et al.
Publicado: (2023)
por: Guo, Zhongfu, et al.
Publicado: (2023)
OServe: Accelerating LLM Serving via Spatial-Temporal Workload Orchestration
por: Jiang, Youhe, et al.
Publicado: (2026)
por: Jiang, Youhe, et al.
Publicado: (2026)
Agentic AI Workload Characteristics
por: Yuan, Yichao, et al.
Publicado: (2026)
por: Yuan, Yichao, et al.
Publicado: (2026)
PipeMax: Enhancing Offline LLM Inference on Commodity GPU Servers
por: Zhang, Hongbin, et al.
Publicado: (2026)
por: Zhang, Hongbin, et al.
Publicado: (2026)
Accelerating Heterogeneous Tensor Parallelism via Flexible Workload Control
por: Wang, Zhigang, et al.
Publicado: (2024)
por: Wang, Zhigang, et al.
Publicado: (2024)
TURNIP: A "Nondeterministic" GPU Runtime with CPU RAM Offload
por: Ding, Zhimin, et al.
Publicado: (2024)
por: Ding, Zhimin, et al.
Publicado: (2024)
Understanding the Landscape of Ampere GPU Memory Errors
por: Zhu, Zhu, et al.
Publicado: (2025)
por: Zhu, Zhu, et al.
Publicado: (2025)
Workload Intelligence: Punching Holes Through the Cloud Abstraction
por: Huang, Lexiang, et al.
Publicado: (2024)
por: Huang, Lexiang, et al.
Publicado: (2024)
Large Scale Multi-GPU Based Parallel Traffic Simulation for Accelerated Traffic Assignment and Propagation
por: Jiang, Xuan, et al.
Publicado: (2024)
por: Jiang, Xuan, et al.
Publicado: (2024)
Improving GPU Multi-Tenancy Through Dynamic Multi-Instance GPU Reconfiguration
por: Wang, Tianyu, et al.
Publicado: (2024)
por: Wang, Tianyu, et al.
Publicado: (2024)
Prediction-Assisted Online Distributed Deep Learning Workload Scheduling in GPU Clusters
por: Luo, Ziyue, et al.
Publicado: (2025)
por: Luo, Ziyue, et al.
Publicado: (2025)
Maya: Optimizing Deep Learning Training Workloads using GPU Runtime Emulation
por: Yarlagadda, Srihas, et al.
Publicado: (2025)
por: Yarlagadda, Srihas, et al.
Publicado: (2025)
Sustainable Graph Analytics Workload Scheduling with Evolutionary Reinforcement Learning in Edge-Cloud Systems
por: Ramicetty, P., et al.
Publicado: (2026)
por: Ramicetty, P., et al.
Publicado: (2026)
Scheduling Deep Learning Jobs in Multi-Tenant GPU Clusters via Wise Resource Sharing
por: Luo, Yizhou, et al.
Publicado: (2024)
por: Luo, Yizhou, et al.
Publicado: (2024)
Ejemplares similares
-
CB-SpMV:A Data Aggregating and Balance Algorithm for Cache-Friendly Block-Based SpMV on GPUs
por: Cong, Xing, et al.
Publicado: (2026) -
A Nonlinear Hash-based Optimization Method for SpMV on GPUs
por: Yan, Chen, et al.
Publicado: (2025) -
Toward Efficient SpMV in Sparse LLMs via Block Extraction and Compressed Storage
por: Lin, Junqing, et al.
Publicado: (2025) -
Mat2Boundary: Treating User-Defined Boundary Condition as SpMV for Distributed PDE Solvers on Block-Structured Grids
por: Cai, Yanzheng, et al.
Publicado: (2026) -
CRIUgpu: Transparent Checkpointing of GPU-Accelerated Workloads
por: Stoyanov, Radostin, et al.
Publicado: (2025)