Distributed and heterogeneous tensor-vector contraction algorithms for high performance computing
Fuente:
arXiv
Salvato in:
| Autori principali: | Martinez-Ferrer, Pedro J., Yzelman, Albert-Jan, Beltran, Vicenç |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ATLAHS: An Application-centric Network Simulator Toolchain for AI, HPC, and Distributed Storage
di: Shen, Siyuan, et al.
Pubblicazione: (2025)
di: Shen, Siyuan, et al.
Pubblicazione: (2025)
Punch Out Model Synthesis: A Stochastic Algorithm for Constraint Based Tiling Generation
di: Zzyzek, Zzyv
Pubblicazione: (2025)
di: Zzyzek, Zzyv
Pubblicazione: (2025)
Canonicalization of Batched Einstein Summations for Tuning Retrieval
di: Kulkarni, Kaushik, et al.
Pubblicazione: (2026)
di: Kulkarni, Kaushik, et al.
Pubblicazione: (2026)
Why does Prediction Accuracy Decrease over Time? Uncertain Positive Learning for Cloud Failure Prediction
di: Li, Haozhe, et al.
Pubblicazione: (2024)
di: Li, Haozhe, et al.
Pubblicazione: (2024)
Scaling Molecular Dynamics with ab initio Accuracy to 149 Nanoseconds per Day
di: Li, Jianxiong, et al.
Pubblicazione: (2024)
di: Li, Jianxiong, et al.
Pubblicazione: (2024)
GPU Acceleration and Portability of the TRIMEG Code for Gyrokinetic Plasma Simulations using OpenMP
di: Daneri, Giorgio
Pubblicazione: (2026)
di: Daneri, Giorgio
Pubblicazione: (2026)
Distributed Simulation of Large Multi-body Systems
di: Kale, Manas, et al.
Pubblicazione: (2024)
di: Kale, Manas, et al.
Pubblicazione: (2024)
A C++17 Thread Pool for High-Performance Scientific Computing
di: Shoshany, Barak
Pubblicazione: (2021)
di: Shoshany, Barak
Pubblicazione: (2021)
Solving Large Rank-Deficient Linear Least-Squares Problems on Shared-Memory CPU Architectures and GPU Architectures
di: Chillarón, Mónica, et al.
Pubblicazione: (2024)
di: Chillarón, Mónica, et al.
Pubblicazione: (2024)
A task-based data-flow methodology for programming heterogeneous systems with multiple accelerator APIs
di: Boné, Aleix, et al.
Pubblicazione: (2026)
di: Boné, Aleix, et al.
Pubblicazione: (2026)
Effective implementation of the High Performance Conjugate Gradient benchmark on GraphBLAS
di: Scolari, Alberto, et al.
Pubblicazione: (2023)
di: Scolari, Alberto, et al.
Pubblicazione: (2023)
MATCH: Model-Aware TVM-based Compilation for Heterogeneous Edge Devices
di: Hamdi, Mohamed Amine, et al.
Pubblicazione: (2024)
di: Hamdi, Mohamed Amine, et al.
Pubblicazione: (2024)
Static Batching of Irregular Workloads on GPUs: Framework and Application to Efficient MoE Model Inference
di: Li, Yinghan, et al.
Pubblicazione: (2025)
di: Li, Yinghan, et al.
Pubblicazione: (2025)
Optimizing Fine-Grained Parallelism Through Dynamic Load Balancing on Multi-Socket Many-Core Systems
di: Wang, Wenyi, et al.
Pubblicazione: (2025)
di: Wang, Wenyi, et al.
Pubblicazione: (2025)
Joint Training on AMD and NVIDIA GPUs
di: Hu, Jon, et al.
Pubblicazione: (2026)
di: Hu, Jon, et al.
Pubblicazione: (2026)
AutoTSMM: An Auto-tuning Framework for Building High-Performance Tall-and-Skinny Matrix-Matrix Multiplication on CPUs
di: Li, Chendi, et al.
Pubblicazione: (2022)
di: Li, Chendi, et al.
Pubblicazione: (2022)
Enabling Practical Transparent Checkpointing for MPI: A Topological Sort Approach
di: Xu, Yao, et al.
Pubblicazione: (2024)
di: Xu, Yao, et al.
Pubblicazione: (2024)
TC-GS: A Faster Gaussian Splatting Module Utilizing Tensor Cores
di: Liao, Zimu, et al.
Pubblicazione: (2025)
di: Liao, Zimu, et al.
Pubblicazione: (2025)
Exceeding the Numerical and Performance Characteristics of IEEE-754 SGEMM with BFloat16 Tensor Cores on GPUs for Scientific Computing
di: Bayraktar, Harun, et al.
Pubblicazione: (2026)
di: Bayraktar, Harun, et al.
Pubblicazione: (2026)
N2N: A Parallel Framework for Large-Scale MILP under Distributed Memory
di: Wang, Longfei, et al.
Pubblicazione: (2025)
di: Wang, Longfei, et al.
Pubblicazione: (2025)
Comparison of Autoscaling Frameworks for Containerised Machine-Learning-Applications in a Local and Cloud Environment
di: Schroeder, Christian, et al.
Pubblicazione: (2023)
di: Schroeder, Christian, et al.
Pubblicazione: (2023)
Vectorized Adaptive Histograms for Sparse Oblique Forests
di: Lubonja, Ariel, et al.
Pubblicazione: (2026)
di: Lubonja, Ariel, et al.
Pubblicazione: (2026)
A Comparative Analysis of Distributed Linear Solvers under Data Heterogeneity
di: Velasevic, Boris, et al.
Pubblicazione: (2023)
di: Velasevic, Boris, et al.
Pubblicazione: (2023)
Faster Distributed Inference-Only Recommender Systems via Bounded Lag Synchronous Collectives
di: Dichev, Kiril, et al.
Pubblicazione: (2025)
di: Dichev, Kiril, et al.
Pubblicazione: (2025)
Challenging Portability Paradigms: FPGA Acceleration Using SYCL and OpenCL
di: de Castro, Manuel, et al.
Pubblicazione: (2024)
di: de Castro, Manuel, et al.
Pubblicazione: (2024)
Stream parallel skeleton optimization
di: Aldinucci, Marco, et al.
Pubblicazione: (2024)
di: Aldinucci, Marco, et al.
Pubblicazione: (2024)
StreamFlow: cross-breeding cloud with HPC
di: Colonnelli, Iacopo, et al.
Pubblicazione: (2020)
di: Colonnelli, Iacopo, et al.
Pubblicazione: (2020)
DNA sequence alignment: An assignment for OpenMP, MPI, and CUDA/OpenCL
di: Gonzalez-Escribano, Arturo, et al.
Pubblicazione: (2024)
di: Gonzalez-Escribano, Arturo, et al.
Pubblicazione: (2024)
Nonlinear spectral clustering with C++ GraphBLAS
di: Pasadakis, Dimosthenis, et al.
Pubblicazione: (2026)
di: Pasadakis, Dimosthenis, et al.
Pubblicazione: (2026)
ReMoE: Boosting Expert Reuse through Router Fine-Tuning in Memory-Constrained MoE LLM Inference
di: Zhu, Xiongwei, et al.
Pubblicazione: (2026)
di: Zhu, Xiongwei, et al.
Pubblicazione: (2026)
Work-Efficient Parallel Non-Maximum Suppression Kernels
di: Oro, David, et al.
Pubblicazione: (2025)
di: Oro, David, et al.
Pubblicazione: (2025)
Breaking (Global) Barriers in Parallel Stochastic Optimization with Wait-Avoiding Group Averaging
di: Li, Shigang, et al.
Pubblicazione: (2020)
di: Li, Shigang, et al.
Pubblicazione: (2020)
HiCR, an Abstract Model for Distributed Heterogeneous Programming
di: Martin, Sergio Miguel, et al.
Pubblicazione: (2025)
di: Martin, Sergio Miguel, et al.
Pubblicazione: (2025)
Improving inference time in multi-TPU systems with profiled model segmentation
di: Villarrubia, Jorge, et al.
Pubblicazione: (2025)
di: Villarrubia, Jorge, et al.
Pubblicazione: (2025)
Balanced segmentation of CNNs for multi-TPU inference
di: Villarrubia, Jorge, et al.
Pubblicazione: (2025)
di: Villarrubia, Jorge, et al.
Pubblicazione: (2025)
Sharded Elimination and Combining for Highly-Efficient Concurrent Stacks
di: Singh, Ajay, et al.
Pubblicazione: (2026)
di: Singh, Ajay, et al.
Pubblicazione: (2026)
On Advanced Monte Carlo Methods for Linear Algebra on Advanced Accelerator Architectures
di: Lebedev, Anton, et al.
Pubblicazione: (2024)
di: Lebedev, Anton, et al.
Pubblicazione: (2024)
cfdSCOPE: A Fluid-Dynamics Proxy App for Teaching Performance Engineering
di: Arzt, Peter, et al.
Pubblicazione: (2025)
di: Arzt, Peter, et al.
Pubblicazione: (2025)
An Evaluation of Massively Parallel Algorithms for DFA Minimization
di: Martens, Jan, et al.
Pubblicazione: (2024)
di: Martens, Jan, et al.
Pubblicazione: (2024)
Agent-based modeling for realistic reproduction of human mobility and contact behavior to evaluate test and isolation strategies in epidemic infectious disease spread
di: Kerkmann, David, et al.
Pubblicazione: (2024)
di: Kerkmann, David, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ATLAHS: An Application-centric Network Simulator Toolchain for AI, HPC, and Distributed Storage
di: Shen, Siyuan, et al.
Pubblicazione: (2025) -
Punch Out Model Synthesis: A Stochastic Algorithm for Constraint Based Tiling Generation
di: Zzyzek, Zzyv
Pubblicazione: (2025) -
Canonicalization of Batched Einstein Summations for Tuning Retrieval
di: Kulkarni, Kaushik, et al.
Pubblicazione: (2026) -
Why does Prediction Accuracy Decrease over Time? Uncertain Positive Learning for Cloud Failure Prediction
di: Li, Haozhe, et al.
Pubblicazione: (2024) -
Scaling Molecular Dynamics with ab initio Accuracy to 149 Nanoseconds per Day
di: Li, Jianxiong, et al.
Pubblicazione: (2024)