GTA: a new General Tensor Accelerator with Better Area Efficiency and Data Reuse
Fuente:
arXiv
Salvato in:
| Autori principali: | Ai, Chenyang, Zhao, Lechuan, Huang, Zhijie, Li, Cangyuan, Wang, Xinan, Wang, Ying |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Rethinking Compute Substrates for 3D-Stacked Near-Memory LLM Decoding: Microarchitecture-Scheduling Co-Design
di: Ai, Chenyang, et al.
Pubblicazione: (2026)
di: Ai, Chenyang, et al.
Pubblicazione: (2026)
Wrong Code, Right Structure: Learning Netlist Representations from Imperfect LLM-Generated RTL
di: Cai, Siyang, et al.
Pubblicazione: (2026)
di: Cai, Siyang, et al.
Pubblicazione: (2026)
Transitive Array: An Efficient GEMM Accelerator with Result Reuse
di: Guo, Cong, et al.
Pubblicazione: (2025)
di: Guo, Cong, et al.
Pubblicazione: (2025)
A Low-Power Sparse Deep Learning Accelerator with Optimized Data Reuse
di: Hsu, Kai-Chieh, et al.
Pubblicazione: (2025)
di: Hsu, Kai-Chieh, et al.
Pubblicazione: (2025)
A Tensor-Train Decomposition based Compression of LLMs on Group Vector Systolic Accelerator
di: Huang, Sixiao, et al.
Pubblicazione: (2025)
di: Huang, Sixiao, et al.
Pubblicazione: (2025)
HyDRA: Deadline and Reuse-Aware Cacheability for Hardware Accelerators
di: Agarwal, Ayushi, et al.
Pubblicazione: (2026)
di: Agarwal, Ayushi, et al.
Pubblicazione: (2026)
An Efficient Data Reuse with Tile-Based Adaptive Stationary for Transformer Accelerators
di: Li, Tseng-Jen, et al.
Pubblicazione: (2025)
di: Li, Tseng-Jen, et al.
Pubblicazione: (2025)
StreamTensor: Make Tensors Stream in Dataflow Accelerators for LLMs
di: Ye, Hanchen, et al.
Pubblicazione: (2025)
di: Ye, Hanchen, et al.
Pubblicazione: (2025)
FADiff: Fusion-Aware Differentiable Optimization for DNN Scheduling on Tensor Accelerators
di: Jia, Shuao, et al.
Pubblicazione: (2025)
di: Jia, Shuao, et al.
Pubblicazione: (2025)
Be CIM or Be Memory: A Dual-mode-aware DNN Compiler for CIM Accelerators
di: Zhao, Shixin, et al.
Pubblicazione: (2025)
di: Zhao, Shixin, et al.
Pubblicazione: (2025)
FETTA: Flexible and Efficient Hardware Accelerator for Tensorized Neural Network Training
di: Lu, Jinming, et al.
Pubblicazione: (2025)
di: Lu, Jinming, et al.
Pubblicazione: (2025)
Algorithmic Strategies for Sustainable Reuse of Neural Network Accelerators with Permanent Faults
di: Alama, Youssef A. Ait, et al.
Pubblicazione: (2024)
di: Alama, Youssef A. Ait, et al.
Pubblicazione: (2024)
Open-source Stand-Alone Versatile Tensor Accelerator
di: Faure-Gignoux, Anthony, et al.
Pubblicazione: (2025)
di: Faure-Gignoux, Anthony, et al.
Pubblicazione: (2025)
ATLAAS: Automatic Tensor-Level Abstraction of Accelerator Semantics
di: Gao, Ruijie, et al.
Pubblicazione: (2026)
di: Gao, Ruijie, et al.
Pubblicazione: (2026)
Systolic Sparse Tensor Slices: FPGA Building Blocks for Sparse and Dense AI Acceleration
di: Taka, Endri, et al.
Pubblicazione: (2025)
di: Taka, Endri, et al.
Pubblicazione: (2025)
A 16 nm 1.60TOPS/W High Utilization DNN Accelerator with 3D Spatial Data Reuse and Efficient Shared Memory Access
di: Yi, Xiaoling, et al.
Pubblicazione: (2026)
di: Yi, Xiaoling, et al.
Pubblicazione: (2026)
Tailors: Accelerating Sparse Tensor Algebra by Overbooking Buffer Capacity
di: Xue, Zi Yu, et al.
Pubblicazione: (2023)
di: Xue, Zi Yu, et al.
Pubblicazione: (2023)
AME-PIM: Can Memory be Your Next Tensor Accelerator?
di: Venieri, Emanuele, et al.
Pubblicazione: (2026)
di: Venieri, Emanuele, et al.
Pubblicazione: (2026)
DiSC: Resolution-Scalable Acceleration of Diffusion Models by Exploiting Sparsity and Cached Token Reuse with Hash-based Distribution
di: Yoon, Jieon, et al.
Pubblicazione: (2026)
di: Yoon, Jieon, et al.
Pubblicazione: (2026)
GEMM-GS: Accelerating 3D Gaussian Splatting on Tensor Cores with GEMM-Compatible Blending
di: Li, Haomin, et al.
Pubblicazione: (2026)
di: Li, Haomin, et al.
Pubblicazione: (2026)
TeAAL: A Declarative Framework for Modeling Sparse Tensor Accelerators
di: Nayak, Nandeeka, et al.
Pubblicazione: (2023)
di: Nayak, Nandeeka, et al.
Pubblicazione: (2023)
LLMulator: Generalizable Cost Modeling for Dataflow Accelerators with Input-Adaptive Control Flow
di: Chang, Kaiyan, et al.
Pubblicazione: (2025)
di: Chang, Kaiyan, et al.
Pubblicazione: (2025)
RPCAcc: A High-Performance and Reconfigurable PCIe-attached RPC Accelerator
di: Zhang, Jie, et al.
Pubblicazione: (2024)
di: Zhang, Jie, et al.
Pubblicazione: (2024)
Enhancing CGRA Efficiency Through Aligned Compute and Communication Provisioning
di: Li, Zhaoying, et al.
Pubblicazione: (2024)
di: Li, Zhaoying, et al.
Pubblicazione: (2024)
Tensor Manipulation Unit (TMU): Reconfigurable, Near-Memory Tensor Manipulation for High-Throughput AI SoC
di: Zhou, Weiyu, et al.
Pubblicazione: (2025)
di: Zhou, Weiyu, et al.
Pubblicazione: (2025)
Reuse Detector: Improving the Management of STT-RAM SLLCs
di: RodrÍguez-RodrÍguez, Roberto, et al.
Pubblicazione: (2024)
di: RodrÍguez-RodrÍguez, Roberto, et al.
Pubblicazione: (2024)
RTeAAL Sim: Using Tensor Algebra to Represent and Accelerate RTL Simulation (Extended Version)
di: Zhu, Yan, et al.
Pubblicazione: (2026)
di: Zhu, Yan, et al.
Pubblicazione: (2026)
NDSEARCH: Accelerating Graph-Traversal-Based Approximate Nearest Neighbor Search through Near Data Processing
di: Wang, Yitu, et al.
Pubblicazione: (2023)
di: Wang, Yitu, et al.
Pubblicazione: (2023)
HiHGNN: Accelerating HGNNs through Parallelism and Data Reusability Exploitation
di: Xue, Runzhen, et al.
Pubblicazione: (2023)
di: Xue, Runzhen, et al.
Pubblicazione: (2023)
VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator
di: Wang, Zhican, et al.
Pubblicazione: (2025)
di: Wang, Zhican, et al.
Pubblicazione: (2025)
ChipSeek: Optimizing Verilog Generation via EDA-Integrated Reinforcement Learning
di: Chen, Zhirong, et al.
Pubblicazione: (2025)
di: Chen, Zhirong, et al.
Pubblicazione: (2025)
Natural language is not enough: Benchmarking multi-modal generative AI for Verilog generation
di: Chang, Kaiyan, et al.
Pubblicazione: (2024)
di: Chang, Kaiyan, et al.
Pubblicazione: (2024)
Modeling Analog-Digital-Converter Energy and Area for Compute-In-Memory Accelerator Design
di: Andrulis, Tanner, et al.
Pubblicazione: (2024)
di: Andrulis, Tanner, et al.
Pubblicazione: (2024)
Tensor Memory Engine: On-the-fly Data Reorganization for Ideal Locality
di: Hoornaert, Denis, et al.
Pubblicazione: (2026)
di: Hoornaert, Denis, et al.
Pubblicazione: (2026)
PIMSYN: Synthesizing Processing-in-memory CNN Accelerators
di: Li, Wanqian, et al.
Pubblicazione: (2024)
di: Li, Wanqian, et al.
Pubblicazione: (2024)
DIRC-RAG: Accelerating Edge RAG with Robust High-Density and High-Loading-Bandwidth Digital In-ReRAM Computation
di: Shao, Kunming, et al.
Pubblicazione: (2025)
di: Shao, Kunming, et al.
Pubblicazione: (2025)
Efficient yet Accurate End-to-End SC Accelerator Design
di: Li, Meng, et al.
Pubblicazione: (2024)
di: Li, Meng, et al.
Pubblicazione: (2024)
Accelerating Multi-Scale Deformable Attention Using Near-Memory-Processing Architecture
di: Li, Huize, et al.
Pubblicazione: (2026)
di: Li, Huize, et al.
Pubblicazione: (2026)
SRAM Based Digital Custom Compute Engine for Improved Area Efficiency of AI Hardware
di: Dhakad, Narendra Singh, et al.
Pubblicazione: (2026)
di: Dhakad, Narendra Singh, et al.
Pubblicazione: (2026)
Generalized Ping-Pong: Off-Chip Memory Bandwidth Centric Pipelining Strategy for Processing-In-Memory Accelerators
di: Wang, Ruibao, et al.
Pubblicazione: (2024)
di: Wang, Ruibao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Rethinking Compute Substrates for 3D-Stacked Near-Memory LLM Decoding: Microarchitecture-Scheduling Co-Design
di: Ai, Chenyang, et al.
Pubblicazione: (2026) -
Wrong Code, Right Structure: Learning Netlist Representations from Imperfect LLM-Generated RTL
di: Cai, Siyang, et al.
Pubblicazione: (2026) -
Transitive Array: An Efficient GEMM Accelerator with Result Reuse
di: Guo, Cong, et al.
Pubblicazione: (2025) -
A Low-Power Sparse Deep Learning Accelerator with Optimized Data Reuse
di: Hsu, Kai-Chieh, et al.
Pubblicazione: (2025) -
A Tensor-Train Decomposition based Compression of LLMs on Group Vector Systolic Accelerator
di: Huang, Sixiao, et al.
Pubblicazione: (2025)