Machine-Learning-Driven Runtime Optimization of BLAS Level 3 on Modern Multi-Core Systems
Fuente:
arXiv
Saved in:
| Main Authors: | Xia, Yufan, Barca, Giuseppe Maria Junior |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Machine Learning Approach Towards Runtime Optimisation of Matrix Multiplication
by: Xia, Yufan, et al.
Published: (2026)
by: Xia, Yufan, et al.
Published: (2026)
A Readiness-Driven Runtime for Pipeline-Parallel Training under Runtime Variability
by: Liu, Ruitao, et al.
Published: (2026)
by: Liu, Ruitao, et al.
Published: (2026)
Maya: Optimizing Deep Learning Training Workloads using GPU Runtime Emulation
by: Yarlagadda, Srihas, et al.
Published: (2025)
by: Yarlagadda, Srihas, et al.
Published: (2025)
Runtime-Orchestrated Second-Order Optimization for Scalable LLM Training
by: Lu, Yishun, et al.
Published: (2026)
by: Lu, Yishun, et al.
Published: (2026)
SMART: A Surrogate Model for Predicting Application Runtime in Dragonfly Systems
by: Wang, Xin, et al.
Published: (2025)
by: Wang, Xin, et al.
Published: (2025)
DYNAMIX: RL-based Adaptive Batch Size Optimization in Distributed Machine Learning Systems
by: Dai, Yuanjun, et al.
Published: (2025)
by: Dai, Yuanjun, et al.
Published: (2025)
Provenance Tracking in Large-Scale Machine Learning Systems
by: Padovani, Gabriele, et al.
Published: (2025)
by: Padovani, Gabriele, et al.
Published: (2025)
FedTilt: Towards Multi-Level Fairness-Preserving and Robust Federated Learning
by: Zhang, Binghui, et al.
Published: (2025)
by: Zhang, Binghui, et al.
Published: (2025)
Optimizing Performance on Trinity Utilizing Machine Learning, Proxy Applications and Scheduling Priorities
by: Romero, Phil
Published: (2024)
by: Romero, Phil
Published: (2024)
A Modern Approach to Real-Time Air Traffic Management System
by: Vaidya, Priyank, et al.
Published: (2025)
by: Vaidya, Priyank, et al.
Published: (2025)
FlashMem: Supporting Modern DNN Workloads on Mobile with GPU Memory Hierarchy Optimizations
by: Shu, Zhihao, et al.
Published: (2026)
by: Shu, Zhihao, et al.
Published: (2026)
QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration
by: Imani, HamidReza, et al.
Published: (2025)
by: Imani, HamidReza, et al.
Published: (2025)
Adaptive Approach to Enhance Machine Learning Scheduling Algorithms During Runtime Using Reinforcement Learning in Metascheduling Applications
by: Alshaer, Samer, et al.
Published: (2025)
by: Alshaer, Samer, et al.
Published: (2025)
yProv4ML: Effortless Provenance Tracking for Machine Learning Systems
by: Padovani, Gabriele, et al.
Published: (2025)
by: Padovani, Gabriele, et al.
Published: (2025)
Leveraging Neural Graph Compilers in Machine Learning Research for Edge-Cloud Systems
by: Furutanpey, Alireza, et al.
Published: (2025)
by: Furutanpey, Alireza, et al.
Published: (2025)
A Robust Power Model Training Framework for Cloud Native Runtime Energy Metric Exporter
by: Choochotkaew, Sunyanan, et al.
Published: (2024)
by: Choochotkaew, Sunyanan, et al.
Published: (2024)
OpenG2G: A Simulation Platform for AI Datacenter-Grid Runtime Coordination
by: Chung, Jae-Won, et al.
Published: (2026)
by: Chung, Jae-Won, et al.
Published: (2026)
Heterogeneity: An Open Challenge for Federated On-board Machine Learning
by: Hartmann, Maria, et al.
Published: (2024)
by: Hartmann, Maria, et al.
Published: (2024)
ARGO: An Auto-Tuning Runtime System for Scalable GNN Training on Multi-Core Processor
by: Lin, Yi-Chien, et al.
Published: (2024)
by: Lin, Yi-Chien, et al.
Published: (2024)
Federated Learning Survey: A Multi-Level Taxonomy of Aggregation Techniques, Experimental Insights, and Future Frontiers
by: Arbaoui, Meriem, et al.
Published: (2025)
by: Arbaoui, Meriem, et al.
Published: (2025)
FedClust: Optimizing Federated Learning on Non-IID Data through Weight-Driven Client Clustering
by: Islam, Md Sirajul, et al.
Published: (2024)
by: Islam, Md Sirajul, et al.
Published: (2024)
ReSpec: Towards Optimizing Speculative Decoding in Reinforcement Learning Systems
by: Chen, Qiaoling, et al.
Published: (2025)
by: Chen, Qiaoling, et al.
Published: (2025)
MorphServe: Efficient and Workload-Aware LLM Serving via Runtime Quantized Layer Swapping and KV Cache Resizing
by: Su, Zhaoyuan, et al.
Published: (2025)
by: Su, Zhaoyuan, et al.
Published: (2025)
A Fast Task Offloading Optimization Framework for IRS-Assisted Multi-Access Edge Computing System
by: Wu, Jianqiu, et al.
Published: (2023)
by: Wu, Jianqiu, et al.
Published: (2023)
Towards Client Driven Federated Learning
by: Li, Songze, et al.
Published: (2024)
by: Li, Songze, et al.
Published: (2024)
Asynchronous Multi-Model Dynamic Federated Learning over Wireless Networks: Theory, Modeling, and Optimization
by: Chang, Zhan-Lun, et al.
Published: (2023)
by: Chang, Zhan-Lun, et al.
Published: (2023)
Fused3S: Fast Sparse Attention on Tensor Cores
by: Li, Zitong, et al.
Published: (2025)
by: Li, Zitong, et al.
Published: (2025)
FedFog: Network-Aware Optimization of Federated Learning over Wireless Fog-Cloud Systems
by: Nguyen, Van-Dinh, et al.
Published: (2021)
by: Nguyen, Van-Dinh, et al.
Published: (2021)
Ecomap: Sustainability-Driven Optimization of Multi-Tenant DNN Execution on Edge Servers
by: Paramanayakam, Varatheepan, et al.
Published: (2025)
by: Paramanayakam, Varatheepan, et al.
Published: (2025)
cedar: Optimized and Unified Machine Learning Input Data Pipelines
by: Zhao, Mark, et al.
Published: (2024)
by: Zhao, Mark, et al.
Published: (2024)
Event-Driven Online Vertical Federated Learning
by: Wang, Ganyu, et al.
Published: (2025)
by: Wang, Ganyu, et al.
Published: (2025)
ScalableHD: Scalable and High-Throughput Hyperdimensional Computing Inference on Multi-Core CPUs
by: Parikh, Dhruv, et al.
Published: (2025)
by: Parikh, Dhruv, et al.
Published: (2025)
Federated Communication-Efficient Multi-Objective Optimization
by: Askin, Baris, et al.
Published: (2024)
by: Askin, Baris, et al.
Published: (2024)
Machine Learning for Consistency Violation Faults Analysis
by: Giri, Kamal, et al.
Published: (2025)
by: Giri, Kamal, et al.
Published: (2025)
SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models
by: Wu, Hang, et al.
Published: (2025)
by: Wu, Hang, et al.
Published: (2025)
Multi-objective methods in Federated Learning: A survey and taxonomy
by: Hartmann, Maria, et al.
Published: (2025)
by: Hartmann, Maria, et al.
Published: (2025)
Knowledge-Driven Federated Graph Learning on Model Heterogeneity
by: Wu, Zhengyu, et al.
Published: (2025)
by: Wu, Zhengyu, et al.
Published: (2025)
Nonlinear spectral clustering with C++ GraphBLAS
by: Pasadakis, Dimosthenis, et al.
Published: (2026)
by: Pasadakis, Dimosthenis, et al.
Published: (2026)
Learning Semantics, Not Addresses: Runtime Neural Prefetching for Far Memory
by: Huang, Yutong, et al.
Published: (2025)
by: Huang, Yutong, et al.
Published: (2025)
Flexible Clustered Federated Learning for Client-Level Data Distribution Shift
by: Duan, Moming, et al.
Published: (2021)
by: Duan, Moming, et al.
Published: (2021)
Similar Items
-
A Machine Learning Approach Towards Runtime Optimisation of Matrix Multiplication
by: Xia, Yufan, et al.
Published: (2026) -
A Readiness-Driven Runtime for Pipeline-Parallel Training under Runtime Variability
by: Liu, Ruitao, et al.
Published: (2026) -
Maya: Optimizing Deep Learning Training Workloads using GPU Runtime Emulation
by: Yarlagadda, Srihas, et al.
Published: (2025) -
Runtime-Orchestrated Second-Order Optimization for Scalable LLM Training
by: Lu, Yishun, et al.
Published: (2026) -
SMART: A Surrogate Model for Predicting Application Runtime in Dragonfly Systems
by: Wang, Xin, et al.
Published: (2025)