Enregistré dans:
| Auteurs principaux: | Bernaschi, Massimo, Celestini, Alessandro, D'Ambra, Pasqua, Richelli, Giorgio |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2510.02878 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GoldbachGPU: An Open Source GPU-Accelerated Framework for Verification of Goldbach's Conjecture
par: Llorente-Saguer, Isaac
Publié: (2026)
par: Llorente-Saguer, Isaac
Publié: (2026)
Xabclib:A Fully Auto-tuned Sparse Iterative Solver
par: Katagiri, Takahiro, et autres
Publié: (2024)
par: Katagiri, Takahiro, et autres
Publié: (2024)
Automated MPI-X code generation for scalable finite-difference solvers
par: Bisbas, George, et autres
Publié: (2023)
par: Bisbas, George, et autres
Publié: (2023)
NApy: Efficient Statistics in Python for Large-Scale Heterogeneous Data with Enhanced Support for Missing Data
par: Woller, Fabian, et autres
Publié: (2025)
par: Woller, Fabian, et autres
Publié: (2025)
A Communication Avoiding and Reducing Algorithm for Symmetric Eigenproblem for Very Small Matrices
par: Katagiri, Takahiro, et autres
Publié: (2024)
par: Katagiri, Takahiro, et autres
Publié: (2024)
Beating vDSP: A 138 GFLOPS Radix-8 Stockham FFT on Apple Silicon via Two-Tier Register-Threadgroup Memory Decomposition
par: Bergach, Mohamed Amine
Publié: (2026)
par: Bergach, Mohamed Amine
Publié: (2026)
Performance measurements of modern Fortran MPI applications with Score-P
par: Corbin, Gregor
Publié: (2025)
par: Corbin, Gregor
Publié: (2025)
Black-Scholes Option Pricing on Intel CPUs and GPUs: Implementation on SYCL and Optimization Techniques
par: Panova, Elena, et autres
Publié: (2022)
par: Panova, Elena, et autres
Publié: (2022)
Accelerating High-Order Finite Element Simulations at Extreme Scale with FP64 Tensor Cores
par: Tu, Jiqun, et autres
Publié: (2026)
par: Tu, Jiqun, et autres
Publié: (2026)
pyGinkgo: A Sparse Linear Algebra Operator Framework for Python
par: Tuteja, Keshvi, et autres
Publié: (2025)
par: Tuteja, Keshvi, et autres
Publié: (2025)
Performant Automatic BLAS Offloading on Unified Memory Architecture with OpenMP First-Touch Style Data Movement
par: Li, Junjie
Publié: (2024)
par: Li, Junjie
Publié: (2024)
Integrating Performance Tools in Model Reasoning for GPU Kernel Optimization
par: Nichols, Daniel, et autres
Publié: (2025)
par: Nichols, Daniel, et autres
Publié: (2025)
Hierarchical Recursive Precision for Accelerating Symmetric Linear Solves on MXUs
par: Carrica, Vicki, et autres
Publié: (2026)
par: Carrica, Vicki, et autres
Publié: (2026)
Easy Acceleration with Distributed Arrays
par: Kepner, Jeremy, et autres
Publié: (2025)
par: Kepner, Jeremy, et autres
Publié: (2025)
Optimized thread-block arrangement in a GPU implementation of a linear solver for atmospheric chemistry mechanisms
par: Ruiz, Christian Guzman, et autres
Publié: (2024)
par: Ruiz, Christian Guzman, et autres
Publié: (2024)
Pipelined Dense Symmetric Eigenvalue Decomposition on Multi-GPU Architectures
par: Wang, Hansheng, et autres
Publié: (2025)
par: Wang, Hansheng, et autres
Publié: (2025)
Toward Portable GPU Performance: Julia Recursive Implementation of TRMM and TRSM
par: Carrica, Vicki, et autres
Publié: (2025)
par: Carrica, Vicki, et autres
Publié: (2025)
Ocean: Fast Estimation-Based Sparse General Matrix-Matrix Multiplication on GPU
par: Li, Yifan, et autres
Publié: (2026)
par: Li, Yifan, et autres
Publié: (2026)
Implementing Multi-GPU Scientific Computing Miniapps Across Performance Portable Frameworks
par: Villalobos, Johansell, et autres
Publié: (2025)
par: Villalobos, Johansell, et autres
Publié: (2025)
Communication-Avoiding SpGEMM via Trident Partitioning on Hierarchical GPU Interconnects
par: Bellavita, Julian, et autres
Publié: (2026)
par: Bellavita, Julian, et autres
Publié: (2026)
AI-NativeBench: An Open-Source White-Box Agentic Benchmark Suite for AI-Native Systems
par: Wang, Zirui, et autres
Publié: (2026)
par: Wang, Zirui, et autres
Publié: (2026)
High-level Stream Processing: A Complementary Analysis of Fault Recovery
par: Vogel, Adriano, et autres
Publié: (2024)
par: Vogel, Adriano, et autres
Publié: (2024)
LibProf: A Python Profiler for Improving Cold Start Performance in Serverless Applications
par: Tariq, Syed Salauddin Mohammad, et autres
Publié: (2024)
par: Tariq, Syed Salauddin Mohammad, et autres
Publié: (2024)
Optimizing OpenFaaS on Kubernetes: Comparative Analysis of Language Runtimes and Cluster Distributions
par: Ataie, Ehsan, et autres
Publié: (2026)
par: Ataie, Ehsan, et autres
Publié: (2026)
When Should I Run My Application Benchmark?: Studying Cloud Performance Variability for the Case of Stream Processing Applications
par: Henning, Sören, et autres
Publié: (2025)
par: Henning, Sören, et autres
Publié: (2025)
Where Should I Deploy My Contracts? A Practical Experience Report
par: Lazăr, Cătălina, et autres
Publié: (2025)
par: Lazăr, Cătălina, et autres
Publié: (2025)
MPI Implementation Profiling for Better Application Performance
par: Shipley, Riley, et autres
Publié: (2024)
par: Shipley, Riley, et autres
Publié: (2024)
Should I Run My Cloud Benchmark on Black Friday?
par: Henning, Sören, et autres
Publié: (2025)
par: Henning, Sören, et autres
Publié: (2025)
Profiling and optimization of multi-card GPU machine learning jobs
par: Lawenda, Marcin, et autres
Publié: (2025)
par: Lawenda, Marcin, et autres
Publié: (2025)
Integrating Odeint Time Stepping into OpenFPM for Distributed and GPU Accelerated Numerical Solvers
par: Singh, Abhinav, et autres
Publié: (2023)
par: Singh, Abhinav, et autres
Publié: (2023)
Performant Unified GPU Kernels for Portable Singular Value Computation Across Hardware and Precision
par: Ringoot, Evelyne, et autres
Publié: (2025)
par: Ringoot, Evelyne, et autres
Publié: (2025)
High-Performance Tensor Contraction without Transposition
par: Matthews, Devin A.
Publié: (2016)
par: Matthews, Devin A.
Publié: (2016)
Code Generation for Near-Roofline Finite Element Actions on GPUs from Symbolic Variational Forms
par: Kulkarni, Kaushik, et autres
Publié: (2025)
par: Kulkarni, Kaushik, et autres
Publié: (2025)
Efficient allocation of image recognition and LLM tasks on multi-GPU system
par: Lawenda, Marcin, et autres
Publié: (2025)
par: Lawenda, Marcin, et autres
Publié: (2025)
SYCL compute kernels for ExaHyPE
par: Loi, Chung Ming, et autres
Publié: (2023)
par: Loi, Chung Ming, et autres
Publié: (2023)
Fast and energy-efficient derivatives risk analysis: Streaming option Greeks on Xilinx and Intel FPGAs
par: Klaisoongnoen, Mark, et autres
Publié: (2022)
par: Klaisoongnoen, Mark, et autres
Publié: (2022)
PennyLane-Lightning MPI: A massively scalable quantum circuit simulator based on distributed computing in CPU clusters
par: Kang, Ji-Hoon, et autres
Publié: (2025)
par: Kang, Ji-Hoon, et autres
Publié: (2025)
Blink: CPU-Free LLM Inference by Delegating the Serving Stack to GPU and SmartNIC
par: Siavashi, Mohammad, et autres
Publié: (2026)
par: Siavashi, Mohammad, et autres
Publié: (2026)
GPU Implementations for Midsize Integer Addition and Multiplication
par: Oancea, Cosmin E., et autres
Publié: (2024)
par: Oancea, Cosmin E., et autres
Publié: (2024)
Minos: Systematically Classifying Performance and Power Characteristics of GPU Workloads on HPC Clusters
par: Jain, Rutwik, et autres
Publié: (2026)
par: Jain, Rutwik, et autres
Publié: (2026)
Documents similaires
-
GoldbachGPU: An Open Source GPU-Accelerated Framework for Verification of Goldbach's Conjecture
par: Llorente-Saguer, Isaac
Publié: (2026) -
Xabclib:A Fully Auto-tuned Sparse Iterative Solver
par: Katagiri, Takahiro, et autres
Publié: (2024) -
Automated MPI-X code generation for scalable finite-difference solvers
par: Bisbas, George, et autres
Publié: (2023) -
NApy: Efficient Statistics in Python for Large-Scale Heterogeneous Data with Enhanced Support for Missing Data
par: Woller, Fabian, et autres
Publié: (2025) -
A Communication Avoiding and Reducing Algorithm for Symmetric Eigenproblem for Very Small Matrices
par: Katagiri, Takahiro, et autres
Publié: (2024)