Unlocking the AMD Neural Processing Unit for ML Training on the Client Using Bare-Metal-Programming Tools
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rösti, André, Franz, Michael |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Accelerating CRONet on AMD Versal AIE-ML Engines
par: Mhatre, Kaustubh, et autres
Publié: (2026)
par: Mhatre, Kaustubh, et autres
Publié: (2026)
GAMA: High-Performance GEMM Acceleration on AMD Versal ML-Optimized AI Engines
par: Mhatre, Kaustubh, et autres
Publié: (2025)
par: Mhatre, Kaustubh, et autres
Publié: (2025)
Bare-Metal RISC-V + NVDLA SoC for Efficient Deep Learning Inference
par: Kumar, Vineet, et autres
Publié: (2025)
par: Kumar, Vineet, et autres
Publié: (2025)
ReGate: Enabling Power Gating in Neural Processing Units
par: Xue, Yuqi, et autres
Publié: (2025)
par: Xue, Yuqi, et autres
Publié: (2025)
AMD Versal Implementations of FAM and SSCA Estimators
par: Li, Carol Jingyi, et autres
Publié: (2025)
par: Li, Carol Jingyi, et autres
Publié: (2025)
NeuroAI Temporal Neural Networks (NeuTNNs): Microarchitecture and Design Framework for Specialized Neuromorphic Processing Units
par: Venkatachalam, Shanmuga, et autres
Publié: (2026)
par: Venkatachalam, Shanmuga, et autres
Publié: (2026)
RTGPU: Real-Time Computing with Graphics Processing Units
par: Gheibi-Fetrat, Atiyeh, et autres
Publié: (2025)
par: Gheibi-Fetrat, Atiyeh, et autres
Publié: (2025)
FTTN: Feature-Targeted Testing for Numerical Properties of NVIDIA & AMD Matrix Accelerators
par: Li, Xinyi, et autres
Publié: (2024)
par: Li, Xinyi, et autres
Publié: (2024)
Instruction-Based Coordination of Heterogeneous Processing Units for Acceleration of DNN Inference
par: Petropoulos, Anastasios, et autres
Publié: (2025)
par: Petropoulos, Anastasios, et autres
Publié: (2025)
DPUConfig: Optimizing ML Inference in FPGAs Using Reinforcement Learning
par: Patras, Alexandros, et autres
Publié: (2026)
par: Patras, Alexandros, et autres
Publié: (2026)
AIE4ML: An End-to-End Framework for Compiling Neural Networks for the Next Generation of AMD AI Engines
par: Danopoulos, Dimitrios, et autres
Publié: (2025)
par: Danopoulos, Dimitrios, et autres
Publié: (2025)
Dynamic Power Control in a Hardware Neural Network with Error-Configurable MAC Units
par: Ghaderi, Maedeh, et autres
Publié: (2024)
par: Ghaderi, Maedeh, et autres
Publié: (2024)
e-GPU: An Open-Source and Configurable RISC-V Graphic Processing Unit for TinyAI Applications
par: Machetti, Simone, et autres
Publié: (2025)
par: Machetti, Simone, et autres
Publié: (2025)
ATiM: Autotuning Tensor Programs for Processing-in-DRAM
par: Shin, Yongwon, et autres
Publié: (2024)
par: Shin, Yongwon, et autres
Publié: (2024)
Taming Performance Variability caused by Client-Side Hardware Configuration
par: Antoniou, Georgia, et autres
Publié: (2024)
par: Antoniou, Georgia, et autres
Publié: (2024)
RPU -- A Reasoning Processing Unit
par: Adiletta, Matthew, et autres
Publié: (2026)
par: Adiletta, Matthew, et autres
Publié: (2026)
PPU: Design and Implementation of a Pipelined Full Posit Processing Unit
par: Rossi, Federico, et autres
Publié: (2023)
par: Rossi, Federico, et autres
Publié: (2023)
From Loop Nests to Silicon: Mapping AI Workloads onto AMD NPUs with MLIR-AIR
par: Wang, Erwei, et autres
Publié: (2025)
par: Wang, Erwei, et autres
Publié: (2025)
DaPPA: A Data-Parallel Programming Framework for Processing-in-Memory Architectures
par: Oliveira, Geraldo F., et autres
Publié: (2023)
par: Oliveira, Geraldo F., et autres
Publié: (2023)
Jack Unit: An Area- and Energy-Efficient Multiply-Accumulate (MAC) Unit Supporting Diverse Data Formats
par: Noh, Seock-Hwan, et autres
Publié: (2025)
par: Noh, Seock-Hwan, et autres
Publié: (2025)
MiniFloat-NN and ExSdotp: An ISA Extension and a Modular Open Hardware Unit for Low-Precision Training on RISC-V cores
par: Bertaccini, Luca, et autres
Publié: (2022)
par: Bertaccini, Luca, et autres
Publié: (2022)
Instruction Scheduling in the Saturn Vector Unit
par: Zhao, Jerry, et autres
Publié: (2024)
par: Zhao, Jerry, et autres
Publié: (2024)
FETTA: Flexible and Efficient Hardware Accelerator for Tensorized Neural Network Training
par: Lu, Jinming, et autres
Publié: (2025)
par: Lu, Jinming, et autres
Publié: (2025)
Empowering Vector Architectures for ML: The CAMP Architecture for Matrix Multiplication
par: Nojehdeh, Mohammadreza Esmali, et autres
Publié: (2025)
par: Nojehdeh, Mohammadreza Esmali, et autres
Publié: (2025)
ML-based AIG Timing Prediction to Enhance Logic Optimization
par: Jiang, Wenjing, et autres
Publié: (2024)
par: Jiang, Wenjing, et autres
Publié: (2024)
An Energy-Efficient Approximate Posit Multiply-Divide Unit
par: Thotli, Rishi, et autres
Publié: (2026)
par: Thotli, Rishi, et autres
Publié: (2026)
How to keep pushing ML accelerator performance? Know your rooflines!
par: Verhelst, Marian, et autres
Publié: (2025)
par: Verhelst, Marian, et autres
Publié: (2025)
CXL Topology-Aware and Expander-Driven Prefetching: Unlocking SSD Performance
par: Oh, Dongsuk, et autres
Publié: (2025)
par: Oh, Dongsuk, et autres
Publié: (2025)
Table-Lookup MAC: Scalable Processing of Quantised Neural Networks in FPGA Soft Logic
par: Gerlinghoff, Daniel, et autres
Publié: (2024)
par: Gerlinghoff, Daniel, et autres
Publié: (2024)
Wet TinyML: Chemical Neural Network Using Gene Regulation and Cell Plasticity
par: Somathilaka, Samitha, et autres
Publié: (2024)
par: Somathilaka, Samitha, et autres
Publié: (2024)
From PyTorch to Calyx: An Open-Source Compiler Toolchain for ML Accelerators
par: Xie, Jiahan, et autres
Publié: (2025)
par: Xie, Jiahan, et autres
Publié: (2025)
RACAM: Enhancing DRAM with Reuse-Aware Computation and Automated Mapping for ML Inference
par: Ma, Siyuan, et autres
Publié: (2025)
par: Ma, Siyuan, et autres
Publié: (2025)
Co-Design of CNN Accelerators for TinyML using Approximate Matrix Decomposition
par: Morales, José Juan Hernández, et autres
Publié: (2026)
par: Morales, José Juan Hernández, et autres
Publié: (2026)
Sequential Printed MLP Circuits for Super TinyML Multi-Sensory Applications
par: Saglam, Gurol, et autres
Publié: (2024)
par: Saglam, Gurol, et autres
Publié: (2024)
MTU: The Multifunction Tree Unit for Accelerating Zero-Knowledge Proofs
par: Mo, Jianqiao, et autres
Publié: (2025)
par: Mo, Jianqiao, et autres
Publié: (2025)
Online Training and Inference System on Edge FPGA Using Delayed Feedback Reservoir
par: Ikeda, Sosei, et autres
Publié: (2025)
par: Ikeda, Sosei, et autres
Publié: (2025)
TRACE: Unlocking Effective CXL Bandwidth via Lossless Compression and Precision Scaling
par: Xie, Rui, et autres
Publié: (2025)
par: Xie, Rui, et autres
Publié: (2025)
Accelerating Multi-Scale Deformable Attention Using Near-Memory-Processing Architecture
par: Li, Huize, et autres
Publié: (2026)
par: Li, Huize, et autres
Publié: (2026)
Towards Employing FPGA and ASIP Acceleration to Enable Onboard AI/ML in Space Applications
par: Leon, Vasileios, et autres
Publié: (2025)
par: Leon, Vasileios, et autres
Publié: (2025)
ML-PCM : Machine Learning Technique for Write Optimization in Phase Change Memory (PCM)
par: Desai, Mahek, et autres
Publié: (2025)
par: Desai, Mahek, et autres
Publié: (2025)
Documents similaires
-
Accelerating CRONet on AMD Versal AIE-ML Engines
par: Mhatre, Kaustubh, et autres
Publié: (2026) -
GAMA: High-Performance GEMM Acceleration on AMD Versal ML-Optimized AI Engines
par: Mhatre, Kaustubh, et autres
Publié: (2025) -
Bare-Metal RISC-V + NVDLA SoC for Efficient Deep Learning Inference
par: Kumar, Vineet, et autres
Publié: (2025) -
ReGate: Enabling Power Gating in Neural Processing Units
par: Xue, Yuqi, et autres
Publié: (2025) -
AMD Versal Implementations of FAM and SSCA Estimators
par: Li, Carol Jingyi, et autres
Publié: (2025)