Utilizing Sparsity in the GPU-accelerated Assembly of Schur Complement Matrices in Domain Decomposition Methods
Fuente:
arXiv
Salvato in:
| Autori principali: | Homola, Jakub, Meca, Ondřej, Říha, Lubomír, Brzobohatý, Tomáš |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Assembly of FETI dual operator using CUDA
di: Homola, Jakub, et al.
Pubblicazione: (2025)
di: Homola, Jakub, et al.
Pubblicazione: (2025)
On Advanced Monte Carlo Methods for Linear Algebra on Advanced Accelerator Architectures
di: Lebedev, Anton, et al.
Pubblicazione: (2024)
di: Lebedev, Anton, et al.
Pubblicazione: (2024)
NM-SpMM: Accelerating Matrix Multiplication Using N:M Sparsity with GPGPU
di: Ma, Cong, et al.
Pubblicazione: (2025)
di: Ma, Cong, et al.
Pubblicazione: (2025)
Minimum Cost Loop Nests for Contraction of a Sparse Tensor with a Tensor Network
di: Kanakagiri, Raghavendra, et al.
Pubblicazione: (2023)
di: Kanakagiri, Raghavendra, et al.
Pubblicazione: (2023)
Distributed and heterogeneous tensor-vector contraction algorithms for high performance computing
di: Martinez-Ferrer, Pedro J., et al.
Pubblicazione: (2025)
di: Martinez-Ferrer, Pedro J., et al.
Pubblicazione: (2025)
Solving Large Rank-Deficient Linear Least-Squares Problems on Shared-Memory CPU Architectures and GPU Architectures
di: Chillarón, Mónica, et al.
Pubblicazione: (2024)
di: Chillarón, Mónica, et al.
Pubblicazione: (2024)
Speed, power and cost implications for GPU acceleration of Computational Fluid Dynamics on HPC systems
di: Cooper-Baldock, Zachary, et al.
Pubblicazione: (2024)
di: Cooper-Baldock, Zachary, et al.
Pubblicazione: (2024)
A Systematic Literature Survey of Sparse Matrix-Vector Multiplication
di: Gao, Jianhua, et al.
Pubblicazione: (2024)
di: Gao, Jianhua, et al.
Pubblicazione: (2024)
HYLU: Hybrid Parallel Sparse LU Factorization
di: Chen, Xiaoming
Pubblicazione: (2025)
di: Chen, Xiaoming
Pubblicazione: (2025)
Stream parallel skeleton optimization
di: Aldinucci, Marco, et al.
Pubblicazione: (2024)
di: Aldinucci, Marco, et al.
Pubblicazione: (2024)
StreamFlow: cross-breeding cloud with HPC
di: Colonnelli, Iacopo, et al.
Pubblicazione: (2020)
di: Colonnelli, Iacopo, et al.
Pubblicazione: (2020)
Optimizing Fine-Grained Parallelism Through Dynamic Load Balancing on Multi-Socket Many-Core Systems
di: Wang, Wenyi, et al.
Pubblicazione: (2025)
di: Wang, Wenyi, et al.
Pubblicazione: (2025)
Joint Training on AMD and NVIDIA GPUs
di: Hu, Jon, et al.
Pubblicazione: (2026)
di: Hu, Jon, et al.
Pubblicazione: (2026)
AutoTSMM: An Auto-tuning Framework for Building High-Performance Tall-and-Skinny Matrix-Matrix Multiplication on CPUs
di: Li, Chendi, et al.
Pubblicazione: (2022)
di: Li, Chendi, et al.
Pubblicazione: (2022)
Enabling Practical Transparent Checkpointing for MPI: A Topological Sort Approach
di: Xu, Yao, et al.
Pubblicazione: (2024)
di: Xu, Yao, et al.
Pubblicazione: (2024)
Communication-Efficient, 2D Parallel Stochastic Gradient Descent for Distributed-Memory Optimization
di: Devarakonda, Aditya, et al.
Pubblicazione: (2025)
di: Devarakonda, Aditya, et al.
Pubblicazione: (2025)
Canonicalization of Batched Einstein Summations for Tuning Retrieval
di: Kulkarni, Kaushik, et al.
Pubblicazione: (2026)
di: Kulkarni, Kaushik, et al.
Pubblicazione: (2026)
Shortest paths search method based on the projective description of unweighted mixed graphs
di: Melent'ev, V. A.
Pubblicazione: (2023)
di: Melent'ev, V. A.
Pubblicazione: (2023)
Precision-Aware Iterative Algorithms Based on Group-Shared Exponents of Floating-Point Numbers
di: Gao, Jianhua, et al.
Pubblicazione: (2024)
di: Gao, Jianhua, et al.
Pubblicazione: (2024)
Cascaded Prediction and Asynchronous Execution of Iterative Algorithms on Heterogeneous Platforms
di: Gao, Jianhua, et al.
Pubblicazione: (2024)
di: Gao, Jianhua, et al.
Pubblicazione: (2024)
Sensor Placement for Tsunami Early Warning via Large-Scale Bayesian Optimal Experimental Design
di: Venkat, Sreeram, et al.
Pubblicazione: (2026)
di: Venkat, Sreeram, et al.
Pubblicazione: (2026)
Challenging Portability Paradigms: FPGA Acceleration Using SYCL and OpenCL
di: de Castro, Manuel, et al.
Pubblicazione: (2024)
di: de Castro, Manuel, et al.
Pubblicazione: (2024)
Efficient Parallel Scheduling for Sparse Triangular Solvers
di: Böhnlein, Toni, et al.
Pubblicazione: (2025)
di: Böhnlein, Toni, et al.
Pubblicazione: (2025)
Using matrices in post-processing phase of CFD simulations
di: Argentini, Gianluca
Pubblicazione: (2004)
di: Argentini, Gianluca
Pubblicazione: (2004)
DNA sequence alignment: An assignment for OpenMP, MPI, and CUDA/OpenCL
di: Gonzalez-Escribano, Arturo, et al.
Pubblicazione: (2024)
di: Gonzalez-Escribano, Arturo, et al.
Pubblicazione: (2024)
A C++17 Thread Pool for High-Performance Scientific Computing
di: Shoshany, Barak
Pubblicazione: (2021)
di: Shoshany, Barak
Pubblicazione: (2021)
Hybrid Quantum-HPC Middleware Systems for Adaptive Resource, Workload and Task Management
di: Mantha, Pradeep, et al.
Pubblicazione: (2026)
di: Mantha, Pradeep, et al.
Pubblicazione: (2026)
Scalable Dual Coordinate Descent for Kernel Methods
di: Shao, Zishan, et al.
Pubblicazione: (2024)
di: Shao, Zishan, et al.
Pubblicazione: (2024)
Improving inference time in multi-TPU systems with profiled model segmentation
di: Villarrubia, Jorge, et al.
Pubblicazione: (2025)
di: Villarrubia, Jorge, et al.
Pubblicazione: (2025)
Balanced segmentation of CNNs for multi-TPU inference
di: Villarrubia, Jorge, et al.
Pubblicazione: (2025)
di: Villarrubia, Jorge, et al.
Pubblicazione: (2025)
Sharded Elimination and Combining for Highly-Efficient Concurrent Stacks
di: Singh, Ajay, et al.
Pubblicazione: (2026)
di: Singh, Ajay, et al.
Pubblicazione: (2026)
pLUTo: Enabling Massively Parallel Computation in DRAM via Lookup Tables
di: Ferreira, João Dinis, et al.
Pubblicazione: (2021)
di: Ferreira, João Dinis, et al.
Pubblicazione: (2021)
Dynamic Memory Management on GPUs with SYCL
di: Standish, Russell K.
Pubblicazione: (2025)
di: Standish, Russell K.
Pubblicazione: (2025)
TriADA: Massively Parallel Trilinear Matrix-by-Tensor Multiply-Add Algorithm and Device Architecture for the Acceleration of 3D Discrete Transformations
di: Sedukhin, Stanislav, et al.
Pubblicazione: (2025)
di: Sedukhin, Stanislav, et al.
Pubblicazione: (2025)
NVLang: Unified Static Typing for Actor-Based Concurrency on the BEAM
di: Guerreiro, Miguel de Oliveira
Pubblicazione: (2025)
di: Guerreiro, Miguel de Oliveira
Pubblicazione: (2025)
Scalable Concurrent Queues for GPU
di: Shetty, Pratheek Prakash, et al.
Pubblicazione: (2026)
di: Shetty, Pratheek Prakash, et al.
Pubblicazione: (2026)
A Comparative Analysis of Distributed Linear Solvers under Data Heterogeneity
di: Velasevic, Boris, et al.
Pubblicazione: (2023)
di: Velasevic, Boris, et al.
Pubblicazione: (2023)
VeriFx: Correct Replicated Data Types for the Masses
di: De Porre, Kevin, et al.
Pubblicazione: (2022)
di: De Porre, Kevin, et al.
Pubblicazione: (2022)
Fancy Some Chips for Your TeaStore? Modeling the Control of an Adaptable Discrete System
di: Gallone, Anna, et al.
Pubblicazione: (2025)
di: Gallone, Anna, et al.
Pubblicazione: (2025)
Methodology for GPU Frequency Switching Latency Measurement
di: Velicka, Daniel, et al.
Pubblicazione: (2025)
di: Velicka, Daniel, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Assembly of FETI dual operator using CUDA
di: Homola, Jakub, et al.
Pubblicazione: (2025) -
On Advanced Monte Carlo Methods for Linear Algebra on Advanced Accelerator Architectures
di: Lebedev, Anton, et al.
Pubblicazione: (2024) -
NM-SpMM: Accelerating Matrix Multiplication Using N:M Sparsity with GPGPU
di: Ma, Cong, et al.
Pubblicazione: (2025) -
Minimum Cost Loop Nests for Contraction of a Sparse Tensor with a Tensor Network
di: Kanakagiri, Raghavendra, et al.
Pubblicazione: (2023) -
Distributed and heterogeneous tensor-vector contraction algorithms for high performance computing
di: Martinez-Ferrer, Pedro J., et al.
Pubblicazione: (2025)