SISA: A Scale-In Systolic Array for GEMM Acceleration
Fuente:
arXiv
Salvato in:
| Autori principali: | Altamura, Luigi, Cicero, Alessio, Maceiras, Mateo Vázquez, Maleki, Mohammad Ali, Trancoso, Pedro |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SparseZipper: Enhancing Matrix Extensions to Accelerate SpGEMM on CPUs
di: Ta, Tuan, et al.
Pubblicazione: (2025)
di: Ta, Tuan, et al.
Pubblicazione: (2025)
FREESS: An Educational Simulator of a RISC-V-Inspired Superscalar Processor Based on Tomasulo's Algorithm
di: Giorgi, Roberto
Pubblicazione: (2025)
di: Giorgi, Roberto
Pubblicazione: (2025)
Mestra: Exploring Migration on Virtualized CGRAs
di: Kyriazis, Agamemnon, et al.
Pubblicazione: (2026)
di: Kyriazis, Agamemnon, et al.
Pubblicazione: (2026)
ASTER: Attention-based Spiking Transformer Engine for Event-driven Reasoning
di: Das, Tamoghno, et al.
Pubblicazione: (2025)
di: Das, Tamoghno, et al.
Pubblicazione: (2025)
Fast and Practical Strassen's Matrix Multiplication using FPGAs
di: Ahmad, Afzal, et al.
Pubblicazione: (2024)
di: Ahmad, Afzal, et al.
Pubblicazione: (2024)
Make LLM Inference Affordable to Everyone: Augmenting GPU Memory with NDP-DIMM
di: Liu, Lian, et al.
Pubblicazione: (2025)
di: Liu, Lian, et al.
Pubblicazione: (2025)
MEDEA: A Design-Time Multi-Objective Manager for Energy-Efficient DNN Inference on Heterogeneous Ultra-Low Power Platforms
di: Taji, Hossein, et al.
Pubblicazione: (2025)
di: Taji, Hossein, et al.
Pubblicazione: (2025)
SynapticCore-X: A Modular Neural Processing Architecture for Low-Cost FPGA Acceleration
di: Parameshwara, Arya
Pubblicazione: (2025)
di: Parameshwara, Arya
Pubblicazione: (2025)
FlexiBit: Fully Flexible Precision Bit-parallel Accelerator Architecture for Arbitrary Mixed Precision AI
di: Tahmasebi, Faraz, et al.
Pubblicazione: (2024)
di: Tahmasebi, Faraz, et al.
Pubblicazione: (2024)
Ember: A Compiler for Efficient Embedding Operations on Decoupled Access-Execute Architectures
di: Siracusa, Marco, et al.
Pubblicazione: (2025)
di: Siracusa, Marco, et al.
Pubblicazione: (2025)
OpenEye: A Scalable Open-Source Hardware Accelerator for DNNs
di: Lebold, Denis, et al.
Pubblicazione: (2026)
di: Lebold, Denis, et al.
Pubblicazione: (2026)
SambaNova SN40L: Scaling the AI Memory Wall with Dataflow and Composition of Experts
di: Prabhakar, Raghu, et al.
Pubblicazione: (2024)
di: Prabhakar, Raghu, et al.
Pubblicazione: (2024)
Architecting Long-Context LLM Acceleration with Packing-Prefetch Scheduler and Ultra-Large Capacity On-Chip Memories
di: Lee, Ming-Yen, et al.
Pubblicazione: (2025)
di: Lee, Ming-Yen, et al.
Pubblicazione: (2025)
DSPE: An Energy-Efficient Edge Processor for DeepSeek Inference with MerkleTree-based Incremental Pruning, Multi-Stage Boothing Lookup and Dynamic Adaptive Posit Processing
di: Zhang, Yuhan, et al.
Pubblicazione: (2026)
di: Zhang, Yuhan, et al.
Pubblicazione: (2026)
DARE: An Irregularity-Tolerant Matrix Processing Unit with a Densifying ISA and Filtered Runahead Execution
di: Yang, Xin, et al.
Pubblicazione: (2025)
di: Yang, Xin, et al.
Pubblicazione: (2025)
HERMES: High-Performance RISC-V Memory Hierarchy for ML Workloads
di: Suryadevara, Pranav
Pubblicazione: (2025)
di: Suryadevara, Pranav
Pubblicazione: (2025)
Low Latency GNN Accelerator for Quantum Error Correction
di: Cicero, Alessio, et al.
Pubblicazione: (2026)
di: Cicero, Alessio, et al.
Pubblicazione: (2026)
FPGA-Accelerated RISC-V ISA Extensions for Efficient Neural Network Inference on Edge Devices
di: Parameshwara, Arya, et al.
Pubblicazione: (2025)
di: Parameshwara, Arya, et al.
Pubblicazione: (2025)
A WASM-Subset Stack Architecture for Low-cost FPGAs using Open-Source EDA Flows
di: Chakrabarti, Aradhya
Pubblicazione: (2025)
di: Chakrabarti, Aradhya
Pubblicazione: (2025)
pLUTo: Enabling Massively Parallel Computation in DRAM via Lookup Tables
di: Ferreira, João Dinis, et al.
Pubblicazione: (2021)
di: Ferreira, João Dinis, et al.
Pubblicazione: (2021)
A Compilation Framework for Quantum Circuits with Mid-Circuit Measurement Error Awareness
di: Zhong, Ming, et al.
Pubblicazione: (2025)
di: Zhong, Ming, et al.
Pubblicazione: (2025)
Biological Intuition on Digital Hardware: An RTL Implementation of Poisson-Encoded SNNs for Static Image Classification
di: Das, Debabrata, et al.
Pubblicazione: (2026)
di: Das, Debabrata, et al.
Pubblicazione: (2026)
Research on LLM Acceleration Using the High-Performance RISC-V Processor "Xiangshan" (Nanhu Version) Based on the Open-Source Matrix Instruction Set Extension (Vector Dot Product)
di: Chen, Xu-Hao, et al.
Pubblicazione: (2024)
di: Chen, Xu-Hao, et al.
Pubblicazione: (2024)
Multi-diseases detection with memristive system on chip
di: Wang, Zihan, et al.
Pubblicazione: (2024)
di: Wang, Zihan, et al.
Pubblicazione: (2024)
Time Domain Near Memory Computing Engine
di: Antal, Sarthak, et al.
Pubblicazione: (2026)
di: Antal, Sarthak, et al.
Pubblicazione: (2026)
Exploring the Design Space for Message-Driven Systems for Dynamic Graph Processing using CCA
di: Chandio, Bibrak Qamar, et al.
Pubblicazione: (2024)
di: Chandio, Bibrak Qamar, et al.
Pubblicazione: (2024)
Systolic Arrays and Structured Pruning Co-design for Efficient Transformers in Edge Systems
di: Palacios, Pedro, et al.
Pubblicazione: (2024)
di: Palacios, Pedro, et al.
Pubblicazione: (2024)
Streamlining SIMD ISA Extensions with Takum Arithmetic: A Case Study on Intel AVX10.2
di: Hunhold, Laslo
Pubblicazione: (2025)
di: Hunhold, Laslo
Pubblicazione: (2025)
A comprehensive evaluation of spatial co-execution on GPUs using MPS and MIG technologies
di: Villarrubia, Jorge, et al.
Pubblicazione: (2026)
di: Villarrubia, Jorge, et al.
Pubblicazione: (2026)
Kernel Looping: Eliminating Synchronization Boundaries for Peak Inference Performance
di: Koeplinger, David, et al.
Pubblicazione: (2024)
di: Koeplinger, David, et al.
Pubblicazione: (2024)
An Analytical Cost Model for Fast Evaluation of Multiple Compute-Engine CNN Accelerators
di: Qararyah, Fareed, et al.
Pubblicazione: (2025)
di: Qararyah, Fareed, et al.
Pubblicazione: (2025)
Nonvolatile Charge-Domain Attention with HZO Ferroelectric Capacitors: A Simulation-Based Device-to-System Evaluation
di: Abouagour, Faris
Pubblicazione: (2026)
di: Abouagour, Faris
Pubblicazione: (2026)
Design and Implementation of a RISC-V SoC with Custom DSP Accelerators for Edge Computing
di: Yadav, Priyanshu
Pubblicazione: (2025)
di: Yadav, Priyanshu
Pubblicazione: (2025)
Non-interfering On-line and In-field SoC Testing
di: Strauch, Tobias
Pubblicazione: (2024)
di: Strauch, Tobias
Pubblicazione: (2024)
Global Optimizations & Lightweight Dynamic Logic for Concurrency
di: Pati, Suchita, et al.
Pubblicazione: (2024)
di: Pati, Suchita, et al.
Pubblicazione: (2024)
AMC: Access to Miss Correlation Prefetcher for Evolving Graph Analytics
di: Singh, Abhishek, et al.
Pubblicazione: (2024)
di: Singh, Abhishek, et al.
Pubblicazione: (2024)
Improved Prefetching Techniques for Linked Data Structures
di: Maruszewski, Nikola Vuk
Pubblicazione: (2025)
di: Maruszewski, Nikola Vuk
Pubblicazione: (2025)
A Scalable Architecture for Efficient Multi-bit Fully Homomorphic Encryption
di: Ma, Jiaao, et al.
Pubblicazione: (2025)
di: Ma, Jiaao, et al.
Pubblicazione: (2025)
Taming Wild Branches: Overcoming Hard-to-Predict Branches using the Bullseye Predictor
di: Behrendt, Emet, et al.
Pubblicazione: (2025)
di: Behrendt, Emet, et al.
Pubblicazione: (2025)
A Survey on Hardware Accelerators for Large Language Models
di: Kachris, Christoforos
Pubblicazione: (2024)
di: Kachris, Christoforos
Pubblicazione: (2024)
Documenti analoghi
-
SparseZipper: Enhancing Matrix Extensions to Accelerate SpGEMM on CPUs
di: Ta, Tuan, et al.
Pubblicazione: (2025) -
FREESS: An Educational Simulator of a RISC-V-Inspired Superscalar Processor Based on Tomasulo's Algorithm
di: Giorgi, Roberto
Pubblicazione: (2025) -
Mestra: Exploring Migration on Virtualized CGRAs
di: Kyriazis, Agamemnon, et al.
Pubblicazione: (2026) -
ASTER: Attention-based Spiking Transformer Engine for Event-driven Reasoning
di: Das, Tamoghno, et al.
Pubblicazione: (2025) -
Fast and Practical Strassen's Matrix Multiplication using FPGAs
di: Ahmad, Afzal, et al.
Pubblicazione: (2024)