NOVA: NoC-based Vector Unit for Mapping Attention Layers on a CNN Accelerator
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Upadhyay, Mohit, Juneja, Rohan, Wong, Weng-Fai, Peh, Li-Shiuan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
HALO: Hardware-aware quantization with low critical-path-delay weights for LLM acceleration
von: Juneja, Rohan, et al.
Veröffentlicht: (2025)
von: Juneja, Rohan, et al.
Veröffentlicht: (2025)
Building an Open CGRA Ecosystem for Agile Innovation
von: Juneja, Rohan, et al.
Veröffentlicht: (2025)
von: Juneja, Rohan, et al.
Veröffentlicht: (2025)
Travel Time Based Task Mapping for NoC-Based DNN Accelerator
von: Chen, Yizhi, et al.
Veröffentlicht: (2024)
von: Chen, Yizhi, et al.
Veröffentlicht: (2024)
Nexus Machine: An Active Message Inspired Reconfigurable Architecture for Irregular Workloads
von: Juneja, Rohan, et al.
Veröffentlicht: (2025)
von: Juneja, Rohan, et al.
Veröffentlicht: (2025)
Bit Transition Reduction by Data Transmission Ordering in NoC-based DNN Accelerator
von: Chen, Yizhi, et al.
Veröffentlicht: (2025)
von: Chen, Yizhi, et al.
Veröffentlicht: (2025)
Approximate Logic Synthesis Using BLASYS
von: Ma, Jingxiao, et al.
Veröffentlicht: (2025)
von: Ma, Jingxiao, et al.
Veröffentlicht: (2025)
Demystifying FPGA Hard NoC Performance
von: Liu, Sihao, et al.
Veröffentlicht: (2025)
von: Liu, Sihao, et al.
Veröffentlicht: (2025)
CompAir: Synergizing Complementary PIMs and In-Transit NoC Computation for Efficient LLM Acceleration
von: Li, Hongyi, et al.
Veröffentlicht: (2025)
von: Li, Hongyi, et al.
Veröffentlicht: (2025)
Learning Cache Coherence Traffic for NoC Routing Design
von: Xiong, Guochu, et al.
Veröffentlicht: (2025)
von: Xiong, Guochu, et al.
Veröffentlicht: (2025)
da4ml: Distributed Arithmetic for Real-time Neural Networks on FPGAs
von: Sun, Chang, et al.
Veröffentlicht: (2025)
von: Sun, Chang, et al.
Veröffentlicht: (2025)
LUT Tensor Core: A Software-Hardware Co-Design for LUT-Based Low-Bit LLM Inference
von: Mo, Zhiwen, et al.
Veröffentlicht: (2024)
von: Mo, Zhiwen, et al.
Veröffentlicht: (2024)
LLM-based Behaviour Driven Development for Hardware Design
von: Drechsler, Rolf, et al.
Veröffentlicht: (2025)
von: Drechsler, Rolf, et al.
Veröffentlicht: (2025)
The Turbo-Charged Mapper: Fast and Optimal Mapping for Energy-efficient and Low-latency Accelerator Design
von: Gilbert, Michael, et al.
Veröffentlicht: (2026)
von: Gilbert, Michael, et al.
Veröffentlicht: (2026)
LEAP: LLM Inference on Scalable PIM-NoC Architecture with Balanced Dataflow and Fine-Grained Parallelism
von: Wang, Yimin, et al.
Veröffentlicht: (2025)
von: Wang, Yimin, et al.
Veröffentlicht: (2025)
An SMT Formalization of Mixed-Precision Matrix Multiplication: Modeling Three Generations of Tensor Cores
von: Valpey, Benjamin, et al.
Veröffentlicht: (2025)
von: Valpey, Benjamin, et al.
Veröffentlicht: (2025)
A Novel FPGA-based CNN Hardware Accelerator: Optimization for Convolutional Layers using Karatsuba Ofman Multiplier
von: Sarkar, Amit
Veröffentlicht: (2024)
von: Sarkar, Amit
Veröffentlicht: (2024)
XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA
von: Yu, Feng, et al.
Veröffentlicht: (2026)
von: Yu, Feng, et al.
Veröffentlicht: (2026)
Messaging-based Adaptive Vector Computing (MAVeC) Accelerator for AI Workloads
von: Chowdhury, Md. Rownak Hossain, et al.
Veröffentlicht: (2024)
von: Chowdhury, Md. Rownak Hossain, et al.
Veröffentlicht: (2024)
A Lightweight High-Throughput Collective-Capable NoC for Large-Scale ML Accelerators
von: Colagrande, Luca, et al.
Veröffentlicht: (2026)
von: Colagrande, Luca, et al.
Veröffentlicht: (2026)
Regular mixed-radix DFT matrix factorization for in-place FFT accelerators
von: Salishev, Sergey
Veröffentlicht: (2025)
von: Salishev, Sergey
Veröffentlicht: (2025)
GPU-Augmented OLAP Execution Engine: GPU Offloading
von: Chang, Ilsun
Veröffentlicht: (2025)
von: Chang, Ilsun
Veröffentlicht: (2025)
Instruction Scheduling in the Saturn Vector Unit
von: Zhao, Jerry, et al.
Veröffentlicht: (2024)
von: Zhao, Jerry, et al.
Veröffentlicht: (2024)
CLIPGen: A Chiplet Link IP Modeling and Generation Framework for 2.5D Architecture Exploration
von: Zhu, Zhengping, et al.
Veröffentlicht: (2026)
von: Zhu, Zhengping, et al.
Veröffentlicht: (2026)
DSLR-CNN: Efficient CNN Acceleration using Digit-Serial Left-to-Right Arithmetic
von: Nisar, Malik Zohaib, et al.
Veröffentlicht: (2025)
von: Nisar, Malik Zohaib, et al.
Veröffentlicht: (2025)
PIMSYN: Synthesizing Processing-in-memory CNN Accelerators
von: Li, Wanqian, et al.
Veröffentlicht: (2024)
von: Li, Wanqian, et al.
Veröffentlicht: (2024)
Cross-Layer Design of Vector-Symbolic Computing: Bridging Cognition and Brain-Inspired Hardware Acceleration
von: Du, Shuting, et al.
Veröffentlicht: (2025)
von: Du, Shuting, et al.
Veröffentlicht: (2025)
Dataflow & Tiling Strategies in Edge-AI FPGA Accelerators: A Comprehensive Literature Review
von: Li, Richie
Veröffentlicht: (2025)
von: Li, Richie
Veröffentlicht: (2025)
Fast and Fusiest: An Optimal Fusion-Aware Mapper for Accelerator Design
von: Andrulis, Tanner, et al.
Veröffentlicht: (2026)
von: Andrulis, Tanner, et al.
Veröffentlicht: (2026)
HeatSense: Intelligent Thermal Anomaly Detection for Securing NoC-Enabled MPSoCs
von: Hasanzadeh, Mahdi, et al.
Veröffentlicht: (2025)
von: Hasanzadeh, Mahdi, et al.
Veröffentlicht: (2025)
RidgeWalker: Perfectly Pipelined Graph Random Walks on FPGAs
von: Tan, Hongshi, et al.
Veröffentlicht: (2026)
von: Tan, Hongshi, et al.
Veröffentlicht: (2026)
Table-Lookup MAC: Scalable Processing of Quantised Neural Networks in FPGA Soft Logic
von: Gerlinghoff, Daniel, et al.
Veröffentlicht: (2024)
von: Gerlinghoff, Daniel, et al.
Veröffentlicht: (2024)
A Data-Driven Dynamic Execution Orchestration Architecture
von: Bai, Zhenyu, et al.
Veröffentlicht: (2026)
von: Bai, Zhenyu, et al.
Veröffentlicht: (2026)
Memory Access Vectors: Improving Sampling Fidelity for CPU Performance Simulations
von: Caculo, Sriyash, et al.
Veröffentlicht: (2025)
von: Caculo, Sriyash, et al.
Veröffentlicht: (2025)
Optimizing Neural Networks with Learnable Non-Linear Activation Functions via Lookup-Based FPGA Acceleration
von: Yin, Mengyuan, et al.
Veröffentlicht: (2025)
von: Yin, Mengyuan, et al.
Veröffentlicht: (2025)
Architectural Isolation as a Timing Safety Primitive for Edge AI Medical Devices: Controlled Experimental Evidence on a Shared-Silicon Platform
von: Swami, Akul Mallayya
Veröffentlicht: (2026)
von: Swami, Akul Mallayya
Veröffentlicht: (2026)
Binary Weight Multi-Bit Activation Quantization for Compute-in-Memory CNN Accelerators
von: Zhou, Wenyong, et al.
Veröffentlicht: (2025)
von: Zhou, Wenyong, et al.
Veröffentlicht: (2025)
Multiplier-free In-Memory Vector-Matrix Multiplication Using Distributed Arithmetic
von: Zeller, Felix, et al.
Veröffentlicht: (2025)
von: Zeller, Felix, et al.
Veröffentlicht: (2025)
FlooNoC: A 645 Gbps/link 0.15 pJ/B/hop Open-Source NoC with Wide Physical Links and End-to-End AXI4 Parallel Multi-Stream Support
von: Fischer, Tim, et al.
Veröffentlicht: (2024)
von: Fischer, Tim, et al.
Veröffentlicht: (2024)
A Tensor-Train Decomposition based Compression of LLMs on Group Vector Systolic Accelerator
von: Huang, Sixiao, et al.
Veröffentlicht: (2025)
von: Huang, Sixiao, et al.
Veröffentlicht: (2025)
Reward-Weighted On-Policy Distillation with an Open Property-Equivalence Verifier for NL-to-SVA Generation
von: Zou, Qingyun, et al.
Veröffentlicht: (2026)
von: Zou, Qingyun, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
HALO: Hardware-aware quantization with low critical-path-delay weights for LLM acceleration
von: Juneja, Rohan, et al.
Veröffentlicht: (2025) -
Building an Open CGRA Ecosystem for Agile Innovation
von: Juneja, Rohan, et al.
Veröffentlicht: (2025) -
Travel Time Based Task Mapping for NoC-Based DNN Accelerator
von: Chen, Yizhi, et al.
Veröffentlicht: (2024) -
Nexus Machine: An Active Message Inspired Reconfigurable Architecture for Irregular Workloads
von: Juneja, Rohan, et al.
Veröffentlicht: (2025) -
Bit Transition Reduction by Data Transmission Ordering in NoC-based DNN Accelerator
von: Chen, Yizhi, et al.
Veröffentlicht: (2025)