ITA: An Energy-Efficient Attention and Softmax Accelerator for Quantized Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | İslamoğlu, Gamze, Scherer, Moritz, Paulin, Gianna, Fischer, Tim, Jung, Victor J. B., Garofalo, Angelo, Benini, Luca |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VEXP: A Low-Cost RISC-V ISA Extension for Accelerated Softmax Computation in Transformers
di: Wang, Run, et al.
Pubblicazione: (2025)
di: Wang, Run, et al.
Pubblicazione: (2025)
VMXDOTP: A RISC-V Vector ISA Extension for Efficient Microscaling (MX) Format Acceleration
di: Wipfli, Max, et al.
Pubblicazione: (2026)
di: Wipfli, Max, et al.
Pubblicazione: (2026)
Toward Attention-based TinyML: A Heterogeneous Accelerated Architecture and Automated Deployment Flow
di: Wiese, Philip, et al.
Pubblicazione: (2024)
di: Wiese, Philip, et al.
Pubblicazione: (2024)
MXDOTP: A RISC-V ISA Extension for Enabling Microscaling (MX) Floating-Point Dot Products
di: İslamoğlu, Gamze, et al.
Pubblicazione: (2025)
di: İslamoğlu, Gamze, et al.
Pubblicazione: (2025)
MiniFloat-NN and ExSdotp: An ISA Extension and a Modular Open Hardware Unit for Low-Precision Training on RISC-V cores
di: Bertaccini, Luca, et al.
Pubblicazione: (2022)
di: Bertaccini, Luca, et al.
Pubblicazione: (2022)
A Flexible Template for Edge Generative AI with High-Accuracy Accelerated Softmax & GELU
di: Belano, Andrea, et al.
Pubblicazione: (2024)
di: Belano, Andrea, et al.
Pubblicazione: (2024)
FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
CHIMERA: A Flexible and Scalable 3.1 TOPS/W AI-MCU with Transformer Accelerator and 563 Gb/s Shared-L2 Memory Subsystem with QoS Guarantees
di: Leone, Lorenzo, et al.
Pubblicazione: (2026)
di: Leone, Lorenzo, et al.
Pubblicazione: (2026)
relOBI: A Reliable Low-latency Interconnect for Tightly-Coupled On-chip Communication
di: Rogenmoser, Michael, et al.
Pubblicazione: (2025)
di: Rogenmoser, Michael, et al.
Pubblicazione: (2025)
O-POPE: High-Frequency Pipelined Outer Product based GEMM acceleration with minimal buffering overhead
di: Cammarata, Danilo, et al.
Pubblicazione: (2026)
di: Cammarata, Danilo, et al.
Pubblicazione: (2026)
xTern: Energy-Efficient Ternary Neural Network Inference on RISC-V-Based Edge Systems
di: Rutishauser, Georg, et al.
Pubblicazione: (2024)
di: Rutishauser, Georg, et al.
Pubblicazione: (2024)
Deeploy: Enabling Energy-Efficient Deployment of Small Language Models On Heterogeneous Microcontrollers
di: Scherer, Moritz, et al.
Pubblicazione: (2024)
di: Scherer, Moritz, et al.
Pubblicazione: (2024)
CVA6-VMRT: A Modular Approach Towards Time-Predictable Virtual Memory in a 64-bit Application Class RISC-V Processor
di: Reinwardt, Christopher, et al.
Pubblicazione: (2025)
di: Reinwardt, Christopher, et al.
Pubblicazione: (2025)
Who Checks the Checker? Enhancing Component-level Architectural SEU Fault Tolerance for End-to-End SoC Protection
di: Rogenmoser, Michael, et al.
Pubblicazione: (2026)
di: Rogenmoser, Michael, et al.
Pubblicazione: (2026)
Occamy: A 432-Core 28.1 DP-GFLOP/s/W 83% FPU Utilization Dual-Chiplet, Dual-HBM2E RISC-V-based Accelerator for Stencil and Sparse Linear Algebra Computations with 8-to-64-bit Floating-Point Support in 12nm FinFET
di: Paulin, Gianna, et al.
Pubblicazione: (2024)
di: Paulin, Gianna, et al.
Pubblicazione: (2024)
FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Large Attention-Based Model Inference on Tile-Based Accelerators
di: Zhang, Chi, et al.
Pubblicazione: (2026)
di: Zhang, Chi, et al.
Pubblicazione: (2026)
Dual-Issue Execution of Mixed Integer and Floating-Point Workloads on Energy-Efficient In-Order RISC-V Cores
di: Colagrande, Luca, et al.
Pubblicazione: (2025)
di: Colagrande, Luca, et al.
Pubblicazione: (2025)
Towards Zero-Stall Matrix Multiplication on Energy-Efficient RISC-V Clusters for Machine Learning Acceleration
di: Colagrande, Luca, et al.
Pubblicazione: (2025)
di: Colagrande, Luca, et al.
Pubblicazione: (2025)
TrainDeeploy: Hardware-Accelerated Parameter-Efficient Fine-Tuning of Small Transformer Models at the Extreme Edge
di: Wang, Run, et al.
Pubblicazione: (2026)
di: Wang, Run, et al.
Pubblicazione: (2026)
AraXL: A Physically Scalable, Ultra-Wide RISC-V Vector Processor Design for Fast and Efficient Computation on Long Vectors
di: Purayil, Navaneeth Kunhi, et al.
Pubblicazione: (2025)
di: Purayil, Navaneeth Kunhi, et al.
Pubblicazione: (2025)
Towards Reliable Systems: A Scalable Approach to AXI4 Transaction Monitoring
di: Liang, Chaoqun, et al.
Pubblicazione: (2025)
di: Liang, Chaoqun, et al.
Pubblicazione: (2025)
vCLIC: Towards Fast Interrupt Handling in Virtualized RISC-V Mixed-criticality Systems
di: Zelioli, Enrico, et al.
Pubblicazione: (2024)
di: Zelioli, Enrico, et al.
Pubblicazione: (2024)
A Multicast-Capable AXI Crossbar for Many-core Machine Learning Accelerators
di: Colagrande, Luca, et al.
Pubblicazione: (2025)
di: Colagrande, Luca, et al.
Pubblicazione: (2025)
SARIS: Accelerating Stencil Computations on Energy-Efficient RISC-V Compute Clusters with Indirect Stream Registers
di: Scheffler, Paul, et al.
Pubblicazione: (2024)
di: Scheffler, Paul, et al.
Pubblicazione: (2024)
A Dynamic Allocation Scheme for Adaptive Shared-Memory Mapping on Kilo-core RV Clusters for Attention-Based Model Deployment
di: Wang, Bowen, et al.
Pubblicazione: (2025)
di: Wang, Bowen, et al.
Pubblicazione: (2025)
Distributed Inference with Minimal Off-Chip Traffic for Transformers on Low-Power MCUs
di: Bochem, Severin, et al.
Pubblicazione: (2024)
di: Bochem, Severin, et al.
Pubblicazione: (2024)
SentryCore: A RISC-V Co-Processor System for Safe, Real-Time Control Applications
di: Rogenmoser, Michael, et al.
Pubblicazione: (2024)
di: Rogenmoser, Michael, et al.
Pubblicazione: (2024)
A Gigabit, DMA-enhanced Open-Source Ethernet Controller for Mixed-Criticality Systems
di: Liang, Chaoqun, et al.
Pubblicazione: (2024)
di: Liang, Chaoqun, et al.
Pubblicazione: (2024)
Occamy: A 432-Core Dual-Chiplet Dual-HBM2E 768-DP-GFLOP/s RISC-V System for 8-to-64-bit Dense and Sparse Computing in 12nm FinFET
di: Scheffler, Paul, et al.
Pubblicazione: (2025)
di: Scheffler, Paul, et al.
Pubblicazione: (2025)
Circuits and Systems for Embodied AI: Exploring uJ Multi-Modal Perception for Nano-UAVs on the Kraken Shield
di: Potocnik, Viviane, et al.
Pubblicazione: (2024)
di: Potocnik, Viviane, et al.
Pubblicazione: (2024)
Late Breaking Results: Boosting Efficient Dual-Issue Execution on Lightweight RISC-V Cores
di: Colagrande, Luca, et al.
Pubblicazione: (2026)
di: Colagrande, Luca, et al.
Pubblicazione: (2026)
Quadrilatero: A RISC-V programmable matrix coprocessor for low-power edge applications
di: Cammarata, Danilo, et al.
Pubblicazione: (2025)
di: Cammarata, Danilo, et al.
Pubblicazione: (2025)
STAR: An Efficient Softmax Engine for Attention Model with RRAM Crossbar
di: Zhai, Yifeng, et al.
Pubblicazione: (2024)
di: Zhai, Yifeng, et al.
Pubblicazione: (2024)
Fused-Tiled Layers: Minimizing Data Movement on RISC-V SoCs with Software-Managed Caches
di: Jung, Victor J. B., et al.
Pubblicazione: (2025)
di: Jung, Victor J. B., et al.
Pubblicazione: (2025)
SALSA: Simulated Annealing based Loop-Ordering Scheduler for DNN Accelerators
di: Jung, Victor J. B., et al.
Pubblicazione: (2023)
di: Jung, Victor J. B., et al.
Pubblicazione: (2023)
FractalSync: Lightweight Scalable Global Synchronization of Massive Bulk Synchronous Parallel AI Accelerators
di: Isachi, Victor, et al.
Pubblicazione: (2025)
di: Isachi, Victor, et al.
Pubblicazione: (2025)
FlooNoC: A 645 Gbps/link 0.15 pJ/B/hop Open-Source NoC with Wide Physical Links and End-to-End AXI4 Parallel Multi-Stream Support
di: Fischer, Tim, et al.
Pubblicazione: (2024)
di: Fischer, Tim, et al.
Pubblicazione: (2024)
AXI-REALM: Safe, Modular and Lightweight Traffic Monitoring and Regulation for Heterogeneous Mixed-Criticality Systems
di: Benz, Thomas, et al.
Pubblicazione: (2025)
di: Benz, Thomas, et al.
Pubblicazione: (2025)
Toward Open-Source Chiplets for HPC and AI: Occamy and Beyond
di: Scheffler, Paul, et al.
Pubblicazione: (2025)
di: Scheffler, Paul, et al.
Pubblicazione: (2025)
ControlPULPlet: A Flexible Real-time Multi-core RISC-V Controller for 2.5D Systems-in-package
di: Ottaviano, Alessandro, et al.
Pubblicazione: (2024)
di: Ottaviano, Alessandro, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VEXP: A Low-Cost RISC-V ISA Extension for Accelerated Softmax Computation in Transformers
di: Wang, Run, et al.
Pubblicazione: (2025) -
VMXDOTP: A RISC-V Vector ISA Extension for Efficient Microscaling (MX) Format Acceleration
di: Wipfli, Max, et al.
Pubblicazione: (2026) -
Toward Attention-based TinyML: A Heterogeneous Accelerated Architecture and Automated Deployment Flow
di: Wiese, Philip, et al.
Pubblicazione: (2024) -
MXDOTP: A RISC-V ISA Extension for Enabling Microscaling (MX) Floating-Point Dot Products
di: İslamoğlu, Gamze, et al.
Pubblicazione: (2025) -
MiniFloat-NN and ExSdotp: An ISA Extension and a Modular Open Hardware Unit for Low-Precision Training on RISC-V cores
di: Bertaccini, Luca, et al.
Pubblicazione: (2022)