Towards a high-performance AI compiler with upstream MLIR
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Golin, Renato, Chelini, Lorenzo, Siemieniuk, Adam, Madhu, Kavitha, Hasabnis, Niranjan, Pabst, Hans, Georganas, Evangelos, Heinecke, Alexander |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluation of computational and energy performance in matrix multiplication algorithms on CPU and GPU using MKL, cuBLAS and SYCL
par: Torres, L. A., et autres
Publié: (2024)
par: Torres, L. A., et autres
Publié: (2024)
A Lightweight High-Throughput Collective-Capable NoC for Large-Scale ML Accelerators
par: Colagrande, Luca, et autres
Publié: (2026)
par: Colagrande, Luca, et autres
Publié: (2026)
Accelerating Triangle Counting with Real Processing-in-Memory Systems
par: Asquini, Lorenzo, et autres
Publié: (2025)
par: Asquini, Lorenzo, et autres
Publié: (2025)
Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems
par: Zhang, Chen, et autres
Publié: (2026)
par: Zhang, Chen, et autres
Publié: (2026)
SwarmIO: Towards 100 Million IOPS SSD Emulation for Next-generation GPU-centric Storage Systems
par: Kim, Hyeseong, et autres
Publié: (2026)
par: Kim, Hyeseong, et autres
Publié: (2026)
Fine-Grained Power and Energy Attribution on AMD GPU/APU-Based Exascale Nodes
par: McDaniel, Adam, et autres
Publié: (2026)
par: McDaniel, Adam, et autres
Publié: (2026)
Forge-UGC: FX optimization and register-graph engine for universal graph compiler
par: Kumar, Satyam, et autres
Publié: (2026)
par: Kumar, Satyam, et autres
Publié: (2026)
TT-Edge: A Hardware-Software Co-Design for Energy-Efficient Tensor-Train Decomposition on Edge AI
par: Kwak, Hyunseok, et autres
Publié: (2025)
par: Kwak, Hyunseok, et autres
Publié: (2025)
The DEEP-ER project: I/O and resiliency extensions for the Cluster-Booster architecture
par: Kreuzer, Anke, et autres
Publié: (2019)
par: Kreuzer, Anke, et autres
Publié: (2019)
An Evaluation and Comparison of GPU Hardware and Solver Libraries for Accelerating the OPM Flow Reservoir Simulator
par: Qiu, Tong Dong, et autres
Publié: (2023)
par: Qiu, Tong Dong, et autres
Publié: (2023)
SLIM: A Heterogeneous Accelerator for Edge Inference of Sparse Large Language Model via Adaptive Thresholding
par: Xu, Weihong, et autres
Publié: (2025)
par: Xu, Weihong, et autres
Publié: (2025)
COMET: A Framework for Modeling Compound Operation Dataflows with Explicit Collectives
par: Negi, Shubham, et autres
Publié: (2025)
par: Negi, Shubham, et autres
Publié: (2025)
MVDRAM: Enabling GeMV Execution in Unmodified DRAM for Low-Bit LLM Acceleration
par: Kubo, Tatsuya, et autres
Publié: (2025)
par: Kubo, Tatsuya, et autres
Publié: (2025)
PAM: Processing Across Memory Hierarchy for Efficient KV-centric LLM Serving System
par: Liu, Lian, et autres
Publié: (2026)
par: Liu, Lian, et autres
Publié: (2026)
RAPID-Graph: Recursive All-Pairs Shortest Paths Using Processing-in-Memory for Dynamic Programming on Graphs
par: Chen, Yanru, et autres
Publié: (2025)
par: Chen, Yanru, et autres
Publié: (2025)
Chopper: A Multi-Level GPU Characterization Tool & Derived Insights Into LLM Training Inefficiency
par: Kurzynski, Marco, et autres
Publié: (2025)
par: Kurzynski, Marco, et autres
Publié: (2025)
Efficient deadlock avoidance for 2D mesh NoCs that use OQ or VOQ routers
par: Papaphilippou, Philippos, et autres
Publié: (2023)
par: Papaphilippou, Philippos, et autres
Publié: (2023)
DCRA: A Distributed Chiplet-based Reconfigurable Architecture for Irregular Applications
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
LFOC: A Lightweight Fairness-Oriented Cache Clustering Policy for Commodity Multicores
par: García-García, Adrián, et autres
Publié: (2024)
par: García-García, Adrián, et autres
Publié: (2024)
FlexVector: A SpMM Vector Processor with Flexible VRF for GCNs on Varying-Sparsity Graphs
par: Li, Bohan, et autres
Publié: (2026)
par: Li, Bohan, et autres
Publié: (2026)
Sequence-Aware Split Heuristic to Mitigate SM Underutilization in FlashAttention-3 Low-Head-Count Decoding
par: Font, Martí Llopart, et autres
Publié: (2026)
par: Font, Martí Llopart, et autres
Publié: (2026)
iHAC: A Hybrid Cluster Architecture for Enhanced Performance and Resilience
par: Muntaka, Siddique Abubakr, et autres
Publié: (2026)
par: Muntaka, Siddique Abubakr, et autres
Publié: (2026)
NetSmith: An Optimization Framework for Machine-Discovered Network Topologies
par: Green, Conor, et autres
Publié: (2024)
par: Green, Conor, et autres
Publié: (2024)
SpArch: Efficient Architecture for Sparse Matrix Multiplication
par: Zhang, Zhekai, et autres
Publié: (2020)
par: Zhang, Zhekai, et autres
Publié: (2020)
Navigating the Landscape of Distributed File Systems: Architectures, Implementations, and Considerations
par: Pan, Xueting, et autres
Publié: (2024)
par: Pan, Xueting, et autres
Publié: (2024)
Knowledge-Guided Attention-Inspired Learning for Task Offloading in Vehicle Edge Computing
par: Ma, Ke, et autres
Publié: (2025)
par: Ma, Ke, et autres
Publié: (2025)
Efficient MoE Serving in the Memory-Bound Regime: Balance Activated Experts, Not Tokens
par: Yu, Yanpeng, et autres
Publié: (2025)
par: Yu, Yanpeng, et autres
Publié: (2025)
Design in Tiles: Automating GEMM Deployment on Tile-Based Many-PE Accelerators
par: Shen, Aofeng, et autres
Publié: (2025)
par: Shen, Aofeng, et autres
Publié: (2025)
FengHuang: Next-Generation Memory Orchestration for AI Inferencing
par: Li, Jiamin, et autres
Publié: (2025)
par: Li, Jiamin, et autres
Publié: (2025)
Evaluating Rapid Makespan Predictions for Heterogeneous Systems with Programmable Logic
par: Wilhelm, Martin, et autres
Publié: (2025)
par: Wilhelm, Martin, et autres
Publié: (2025)
Context-aware Simopt-Power: Using structural data with simulation metadata to optimise FPGA designs
par: Wadhwa, Eashan, et autres
Publié: (2026)
par: Wadhwa, Eashan, et autres
Publié: (2026)
PULSAR: Simultaneous Many-Row Activation for Reliable and High-Performance Computing in Off-the-Shelf DRAM Chips
par: Yuksel, Ismail Emir, et autres
Publié: (2023)
par: Yuksel, Ismail Emir, et autres
Publié: (2023)
Tascade: Hardware Support for Atomic-free, Asynchronous and Efficient Reduction Trees
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
par: Sharma, Harsh, et autres
Publié: (2023)
par: Sharma, Harsh, et autres
Publié: (2023)
xPUE: Extending Power Usage Effectiveness Metrics for Cloud Infrastructures
par: Fieni, Guillaume, et autres
Publié: (2025)
par: Fieni, Guillaume, et autres
Publié: (2025)
Kitsune: Enabling Dataflow Execution on GPUs
par: Davies, Michael, et autres
Publié: (2025)
par: Davies, Michael, et autres
Publié: (2025)
CELLO: Co-designing Schedule and Hybrid Implicit/Explicit Buffer for Complex Tensor Reuse
par: Garg, Raveesh, et autres
Publié: (2023)
par: Garg, Raveesh, et autres
Publié: (2023)
Application Experiences on a GPU-Accelerated Arm-based HPC Testbed
par: Elwasif, Wael, et autres
Publié: (2022)
par: Elwasif, Wael, et autres
Publié: (2022)
RapidOMS: FPGA-based Open Modification Spectral Library Searching with HD Computing
par: Pinge, Sumukh, et autres
Publié: (2024)
par: Pinge, Sumukh, et autres
Publié: (2024)
DP-HLS: A High-Level Synthesis Framework for Accelerating Dynamic Programming Algorithms in Bioinformatics
par: Cao, Yingqi, et autres
Publié: (2024)
par: Cao, Yingqi, et autres
Publié: (2024)
Documents similaires
-
Evaluation of computational and energy performance in matrix multiplication algorithms on CPU and GPU using MKL, cuBLAS and SYCL
par: Torres, L. A., et autres
Publié: (2024) -
A Lightweight High-Throughput Collective-Capable NoC for Large-Scale ML Accelerators
par: Colagrande, Luca, et autres
Publié: (2026) -
Accelerating Triangle Counting with Real Processing-in-Memory Systems
par: Asquini, Lorenzo, et autres
Publié: (2025) -
Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems
par: Zhang, Chen, et autres
Publié: (2026) -
SwarmIO: Towards 100 Million IOPS SSD Emulation for Next-generation GPU-centric Storage Systems
par: Kim, Hyeseong, et autres
Publié: (2026)