PerfDojo: Automated ML Library Generation for Heterogeneous Architectures
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ivanov, Andrei, Shen, Siyuan, Gottardo, Gioele, Chrapek, Marcin, Boudaoud, Afif, Schneider, Timo, Benini, Luca, Hoefler, Torsten |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DaCe AD: Unifying High-Performance Automatic Differentiation for Machine Learning and Scientific Computing
par: Boudaoud, Afif, et autres
Publié: (2025)
par: Boudaoud, Afif, et autres
Publié: (2025)
EDAN: Towards Understanding Memory Parallelism and Latency Sensitivity in HPC
par: Shen, Siyuan, et autres
Publié: (2025)
par: Shen, Siyuan, et autres
Publié: (2025)
Confidential LLM Inference: Performance and Cost Across CPU and GPU TEEs
par: Chrapek, Marcin, et autres
Publié: (2025)
par: Chrapek, Marcin, et autres
Publié: (2025)
LLAMP: Assessing Network Latency Tolerance of HPC Applications with Linear Programming
par: Shen, Siyuan, et autres
Publié: (2024)
par: Shen, Siyuan, et autres
Publié: (2024)
LOOPerSet: A Large-Scale Dataset for Data-Driven Polyhedral Compiler Optimization
par: Merouani, Massinissa, et autres
Publié: (2025)
par: Merouani, Massinissa, et autres
Publié: (2025)
ADELIA: Automatic Differentiation for Efficient Laplace Inference Approximations
par: Boudaoud, Afif, et autres
Publié: (2026)
par: Boudaoud, Afif, et autres
Publié: (2026)
FPsPIN: An FPGA-based Open-Hardware Research Platform for Processing in the Network
par: Schneider, Timo, et autres
Publié: (2024)
par: Schneider, Timo, et autres
Publié: (2024)
A Priori Loop Nest Normalization: Automatic Loop Scheduling in Complex Applications
par: Trümper, Lukas, et autres
Publié: (2024)
par: Trümper, Lukas, et autres
Publié: (2024)
PerfSeer: An Efficient and Accurate Deep Learning Models Performance Predictor
par: Zhao, Xinlong, et autres
Publié: (2025)
par: Zhao, Xinlong, et autres
Publié: (2025)
Iterating Pointers: Enabling Static Analysis for Loop-based Pointers
par: Lepori, Andrea, et autres
Publié: (2025)
par: Lepori, Andrea, et autres
Publié: (2025)
OSMOSIS: Enabling Multi-Tenancy in Datacenter SmartNICs
par: Khalilov, Mikhail, et autres
Publié: (2023)
par: Khalilov, Mikhail, et autres
Publié: (2023)
PerfBench: Can Agents Resolve Real-World Performance Bugs?
par: Garg, Spandan, et autres
Publié: (2025)
par: Garg, Spandan, et autres
Publié: (2025)
Inductive Loop Analysis for Practical HPC Application Optimization
par: Schaad, Philipp, et autres
Publié: (2025)
par: Schaad, Philipp, et autres
Publié: (2025)
PICO: Performance Insights for Collective Operations
par: Pasqualoni, Saverio, et autres
Publié: (2025)
par: Pasqualoni, Saverio, et autres
Publié: (2025)
Software Resource Disaggregation for HPC with Serverless Computing
par: Copik, Marcin, et autres
Publié: (2024)
par: Copik, Marcin, et autres
Publié: (2024)
Modeling and Controlling Many-Core HPC Processors: an Alternative to PID and Moving Average Algorithms
par: Bambini, Giovanni, et autres
Publié: (2024)
par: Bambini, Giovanni, et autres
Publié: (2024)
Data-Driven Power Modeling and Monitoring via Hardware Performance Counter Tracking
par: Mazzola, Sergio, et autres
Publié: (2025)
par: Mazzola, Sergio, et autres
Publié: (2025)
Data-Driven Power Modeling and Monitoring via Hardware Performance Counters Tracking
par: Mazzola, Sergio, et autres
Publié: (2024)
par: Mazzola, Sergio, et autres
Publié: (2024)
Understanding Data Movement in Tightly Coupled Heterogeneous Systems: A Case Study with the Grace Hopper Superchip
par: Fusco, Luigi, et autres
Publié: (2024)
par: Fusco, Luigi, et autres
Publié: (2024)
Performance Characterization and Optimizations of Traditional ML Applications
par: Kumar, Harsh, et autres
Publié: (2024)
par: Kumar, Harsh, et autres
Publié: (2024)
Profiling Apple Silicon Performance for ML Training
par: Feng, Dahua, et autres
Publié: (2025)
par: Feng, Dahua, et autres
Publié: (2025)
V-Seek: Accelerating LLM Reasoning on Open-hardware Server-class RISC-V Platforms
par: Rodrigo, Javier J. Poveda, et autres
Publié: (2025)
par: Rodrigo, Javier J. Poveda, et autres
Publié: (2025)
Denoising Application Performance Models with Noise-Resilient Priors
par: de Morais, Gustavo, et autres
Publié: (2025)
par: de Morais, Gustavo, et autres
Publié: (2025)
Scalable Packed Layouts for Vector-Length-Agnostic ML Code Generation
par: Beysel, Ege, et autres
Publié: (2026)
par: Beysel, Ege, et autres
Publié: (2026)
Near-Optimal Wafer-Scale Reduce
par: Luczynski, Piotr, et autres
Publié: (2024)
par: Luczynski, Piotr, et autres
Publié: (2024)
Heterogeneous Memory Pool Tuning
par: Vaverka, Filip, et autres
Publié: (2025)
par: Vaverka, Filip, et autres
Publié: (2025)
Ecoscape: Fault Tolerance Benchmark for Adaptive Remediation Strategies in Real-Time Edge ML
par: Reiter, Hendrik, et autres
Publié: (2025)
par: Reiter, Hendrik, et autres
Publié: (2025)
Hardware Acceleration for Knowledge Graph Processing: Challenges & Recent Developments
par: Besta, Maciej, et autres
Publié: (2024)
par: Besta, Maciej, et autres
Publié: (2024)
Rethinking Temporal Models for TinyML: LSTM versus 1D-CNN in Resource-Constrained Devices
par: Saha, Bidyut, et autres
Publié: (2026)
par: Saha, Bidyut, et autres
Publié: (2026)
Enabling Heterogeneous Performance Analysis for Scientific Workloads
par: Graczyk, Maksymilian, et autres
Publié: (2025)
par: Graczyk, Maksymilian, et autres
Publié: (2025)
Cheddar: A Swift Fully Homomorphic Encryption Library Designed for GPU Architectures
par: Choi, Wonseok, et autres
Publié: (2024)
par: Choi, Wonseok, et autres
Publié: (2024)
Ariel-ML: Computing Parallelization with Embedded Rust for Neural Networks on Heterogeneous Multi-core Microcontrollers
par: Huang, Zhaolan, et autres
Publié: (2025)
par: Huang, Zhaolan, et autres
Publié: (2025)
Accelerating Sparse Ternary GEMM for Quantized ML on Apple Silicon
par: Lipshitz, Baraq, et autres
Publié: (2025)
par: Lipshitz, Baraq, et autres
Publié: (2025)
Swing: Short-cutting Rings for Higher Bandwidth Allreduce
par: De Sensi, Daniele, et autres
Publié: (2024)
par: De Sensi, Daniele, et autres
Publié: (2024)
Evaluating the impact of the L3 cache size of AMD EPYC CPUs on the performance of CFD applications
par: Lawenda, Marcin, et autres
Publié: (2025)
par: Lawenda, Marcin, et autres
Publié: (2025)
Analysis and Mitigation of Shared Resource Contention on Heterogeneous Multicore: An Industrial Case Study
par: Bechtel, Michael, et autres
Publié: (2023)
par: Bechtel, Michael, et autres
Publié: (2023)
Automated PMC-based Power Modeling Methodology for Modern Mobile GPUs
par: Dash, Pranab, et autres
Publié: (2024)
par: Dash, Pranab, et autres
Publié: (2024)
Explainable Port Mapping Inference with Sparse Performance Counters for AMD's Zen Architectures
par: Ritter, Fabian, et autres
Publié: (2024)
par: Ritter, Fabian, et autres
Publié: (2024)
Fortify Your Foundations: Practical Privacy and Security for Foundation Model Deployments In The Cloud
par: Chrapek, Marcin, et autres
Publié: (2024)
par: Chrapek, Marcin, et autres
Publié: (2024)
Single-Thread JPEG Decoder Benchmarks Mis-Evaluate ML Data Loaders
par: Iglovikov, Vladimir, et autres
Publié: (2026)
par: Iglovikov, Vladimir, et autres
Publié: (2026)
Documents similaires
-
DaCe AD: Unifying High-Performance Automatic Differentiation for Machine Learning and Scientific Computing
par: Boudaoud, Afif, et autres
Publié: (2025) -
EDAN: Towards Understanding Memory Parallelism and Latency Sensitivity in HPC
par: Shen, Siyuan, et autres
Publié: (2025) -
Confidential LLM Inference: Performance and Cost Across CPU and GPU TEEs
par: Chrapek, Marcin, et autres
Publié: (2025) -
LLAMP: Assessing Network Latency Tolerance of HPC Applications with Linear Programming
par: Shen, Siyuan, et autres
Publié: (2024) -
LOOPerSet: A Large-Scale Dataset for Data-Driven Polyhedral Compiler Optimization
par: Merouani, Massinissa, et autres
Publié: (2025)