MACO: Exploring GEMM Acceleration on a Loosely-Coupled Multi-core Processor
Fuente:
arXiv
Salvato in:
| Autori principali: | Sui, Bingcai, Shen, Junzhong, Sun, Caixia, Wang, Junhui, Zheng, Zhong, Guo, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FASE: FPGA-Assisted Syscall Emulation for Rapid End-to-End Processor Performance Validation
di: Meng, Chengzhen, et al.
Pubblicazione: (2025)
di: Meng, Chengzhen, et al.
Pubblicazione: (2025)
Transitive Array: An Efficient GEMM Accelerator with Result Reuse
di: Guo, Cong, et al.
Pubblicazione: (2025)
di: Guo, Cong, et al.
Pubblicazione: (2025)
GEMM-GS: Accelerating 3D Gaussian Splatting on Tensor Cores with GEMM-Compatible Blending
di: Li, Haomin, et al.
Pubblicazione: (2026)
di: Li, Haomin, et al.
Pubblicazione: (2026)
Efficient Approaches for GEMM Acceleration on Leading AI-Optimized FPGAs
di: Taka, Endri, et al.
Pubblicazione: (2024)
di: Taka, Endri, et al.
Pubblicazione: (2024)
TurboFuzz: FPGA Accelerated Hardware Fuzzing for Processor Agile Verification
di: Zhong, Yang, et al.
Pubblicazione: (2025)
di: Zhong, Yang, et al.
Pubblicazione: (2025)
GAMA: High-Performance GEMM Acceleration on AMD Versal ML-Optimized AI Engines
di: Mhatre, Kaustubh, et al.
Pubblicazione: (2025)
di: Mhatre, Kaustubh, et al.
Pubblicazione: (2025)
FIGLUT: An Energy-Efficient Accelerator Design for FP-INT GEMM Using Look-Up Tables
di: Park, Gunho, et al.
Pubblicazione: (2025)
di: Park, Gunho, et al.
Pubblicazione: (2025)
Optimizing GEMM for Energy and Performance on Versal ACAP Architectures
di: Papalamprou, Ilias, et al.
Pubblicazione: (2025)
di: Papalamprou, Ilias, et al.
Pubblicazione: (2025)
Loop Control Management in Tightly Coupled Processor Arrays (TCPAs)
di: Walter, Dominik, et al.
Pubblicazione: (2026)
di: Walter, Dominik, et al.
Pubblicazione: (2026)
tubGEMM: Energy-Efficient and Sparsity-Effective Temporal-Unary-Binary Based Matrix Multiply Unit
di: Vellaisamy, Prabhu, et al.
Pubblicazione: (2024)
di: Vellaisamy, Prabhu, et al.
Pubblicazione: (2024)
GFormer: Accelerating Large Language Models with Optimized Transformers on Gaudi Processors
di: Zhang, Chengming, et al.
Pubblicazione: (2024)
di: Zhang, Chengming, et al.
Pubblicazione: (2024)
Design in Tiles: Automating GEMM Deployment on Tile-Based Many-PE Accelerators
di: Shen, Aofeng, et al.
Pubblicazione: (2025)
di: Shen, Aofeng, et al.
Pubblicazione: (2025)
Striking the Balance: GEMM Performance Optimization Across Generations of Ryzen AI NPUs
di: Taka, Endri, et al.
Pubblicazione: (2025)
di: Taka, Endri, et al.
Pubblicazione: (2025)
A Scalable FPGA Architecture With Adaptive Memory Utilization for GEMM-Based Operations
di: Petropoulos, Anastasios, et al.
Pubblicazione: (2025)
di: Petropoulos, Anastasios, et al.
Pubblicazione: (2025)
Large Processor Chip Model
di: Chang, Kaiyan, et al.
Pubblicazione: (2025)
di: Chang, Kaiyan, et al.
Pubblicazione: (2025)
SparseZipper: Enhancing Matrix Extensions to Accelerate SpGEMM on CPUs
di: Ta, Tuan, et al.
Pubblicazione: (2025)
di: Ta, Tuan, et al.
Pubblicazione: (2025)
Lyra: A Hardware-Accelerated RISC-V Verification Framework with Generative Model-Based Processor Fuzzing
di: Huo, Juncheng, et al.
Pubblicazione: (2025)
di: Huo, Juncheng, et al.
Pubblicazione: (2025)
Ara2: Exploring Single- and Multi-Core Vector Processing with an Efficient RVV 1.0 Compliant Open-Source Processor
di: Perotti, Matteo, et al.
Pubblicazione: (2023)
di: Perotti, Matteo, et al.
Pubblicazione: (2023)
TMA-Adaptive FP8 Grouped GEMM: Eliminating Padding Requirements in Low-Precision Training and Inference on Hopper
di: Su, Zhongling, et al.
Pubblicazione: (2025)
di: Su, Zhongling, et al.
Pubblicazione: (2025)
A Scalable RISC-V Vector Processor Enabling Efficient Multi-Precision DNN Inference
di: Wang, Chuanning, et al.
Pubblicazione: (2024)
di: Wang, Chuanning, et al.
Pubblicazione: (2024)
Microarchitectural Co-Optimization for Sustained Throughput of RISC-V Multi-Lane Chaining Vector Processors
di: Wang, Weiying, et al.
Pubblicazione: (2026)
di: Wang, Weiying, et al.
Pubblicazione: (2026)
From Circuits to SoC Processors: Arithmetic Approximation Techniques & Embedded Computing Methodologies for DSP Acceleration
di: Leon, Vasileios
Pubblicazione: (2023)
di: Leon, Vasileios
Pubblicazione: (2023)
TROOP: At-the-Roofline Performance for Vector Processors on Low Operational Intensity Workloads
di: Purayil, Navaneeth Kunhi, et al.
Pubblicazione: (2025)
di: Purayil, Navaneeth Kunhi, et al.
Pubblicazione: (2025)
SPEED: A Scalable RISC-V Vector Processor Enabling Efficient Multi-Precision DNN Inference
di: Wang, Chuanning, et al.
Pubblicazione: (2024)
di: Wang, Chuanning, et al.
Pubblicazione: (2024)
O-POPE: High-Frequency Pipelined Outer Product based GEMM acceleration with minimal buffering overhead
di: Cammarata, Danilo, et al.
Pubblicazione: (2026)
di: Cammarata, Danilo, et al.
Pubblicazione: (2026)
tuGEMM: Area-Power-Efficient Temporal Unary GEMM Architecture for Low-Precision Edge AI
di: Nair, Harideep, et al.
Pubblicazione: (2024)
di: Nair, Harideep, et al.
Pubblicazione: (2024)
A Low-Dissipation and Scalable GEMM Accelerator with Silicon Nitride Photonics
di: Karempudi, Venkata Sai Praneeth, et al.
Pubblicazione: (2024)
di: Karempudi, Venkata Sai Praneeth, et al.
Pubblicazione: (2024)
A Quantitative Analysis and Guidelines of Data Streaming Accelerator in Modern Intel Xeon Scalable Processors
di: Kuper, Reese, et al.
Pubblicazione: (2023)
di: Kuper, Reese, et al.
Pubblicazione: (2023)
Hypervisor Extension for a RISC-V Processor
di: Gauchola, Jaume, et al.
Pubblicazione: (2024)
di: Gauchola, Jaume, et al.
Pubblicazione: (2024)
FERIVer: An FPGA-assisted Emulated Framework for RTL Verification of RISC-V Processors
di: Qin, Kun, et al.
Pubblicazione: (2025)
di: Qin, Kun, et al.
Pubblicazione: (2025)
Scaling Analog Photonic Accelerators for Byte-Size, Integer General Matrix Multiply (GEMM) Kernels
di: Alo, Oluwaseun Adewunmi, et al.
Pubblicazione: (2024)
di: Alo, Oluwaseun Adewunmi, et al.
Pubblicazione: (2024)
SkipOPU: An FPGA-based Overlay Processor for Large Language Models with Dynamically Allocated Computation
di: He, Zicheng, et al.
Pubblicazione: (2026)
di: He, Zicheng, et al.
Pubblicazione: (2026)
MERE: Hardware-Software Co-Design for Masking Cache Miss Latency in Embedded Processors
di: You, Dean, et al.
Pubblicazione: (2025)
di: You, Dean, et al.
Pubblicazione: (2025)
SAMIPS: A Synthesised Asynchronous Processor
di: Zhang, Qianyi, et al.
Pubblicazione: (2024)
di: Zhang, Qianyi, et al.
Pubblicazione: (2024)
MultiVic: A Time-Predictable RISC-V Multi-Core Processor Optimized for Neural Network Inference
di: Kirschner, Maximilian, et al.
Pubblicazione: (2025)
di: Kirschner, Maximilian, et al.
Pubblicazione: (2025)
Banked Memories for Soft SIMT Processors
di: Langhammer, Martin, et al.
Pubblicazione: (2025)
di: Langhammer, Martin, et al.
Pubblicazione: (2025)
Reducing the Cost of Dropout in Flash-Attention by Hiding RNG with GEMM
di: Ma, Haiyue, et al.
Pubblicazione: (2024)
di: Ma, Haiyue, et al.
Pubblicazione: (2024)
SoMa: Identifying, Exploring, and Understanding the DRAM Communication Scheduling Space for DNN Accelerators
di: Cai, Jingwei, et al.
Pubblicazione: (2025)
di: Cai, Jingwei, et al.
Pubblicazione: (2025)
A 950 MHz SIMT Soft Processor
di: Langhammer, Martin, et al.
Pubblicazione: (2025)
di: Langhammer, Martin, et al.
Pubblicazione: (2025)
SpecMamba: Accelerating Mamba Inference on FPGA with Speculative Decoding
di: Zhong, Linfeng, et al.
Pubblicazione: (2025)
di: Zhong, Linfeng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FASE: FPGA-Assisted Syscall Emulation for Rapid End-to-End Processor Performance Validation
di: Meng, Chengzhen, et al.
Pubblicazione: (2025) -
Transitive Array: An Efficient GEMM Accelerator with Result Reuse
di: Guo, Cong, et al.
Pubblicazione: (2025) -
GEMM-GS: Accelerating 3D Gaussian Splatting on Tensor Cores with GEMM-Compatible Blending
di: Li, Haomin, et al.
Pubblicazione: (2026) -
Efficient Approaches for GEMM Acceleration on Leading AI-Optimized FPGAs
di: Taka, Endri, et al.
Pubblicazione: (2024) -
TurboFuzz: FPGA Accelerated Hardware Fuzzing for Processor Agile Verification
di: Zhong, Yang, et al.
Pubblicazione: (2025)