Atleus: Accelerating Transformers on the Edge Enabled by 3D Heterogeneous Manycore Architectures
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Dhingra, Pratyush, Doppa, Janardhan Rao, Pande, Partha Pratim |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
HeTraX: Energy Efficient 3D Heterogeneous Manycore Architecture for Transformer Acceleration
von: Dhingra, Pratyush, et al.
Veröffentlicht: (2024)
von: Dhingra, Pratyush, et al.
Veröffentlicht: (2024)
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
von: Sharma, Harsh, et al.
Veröffentlicht: (2023)
von: Sharma, Harsh, et al.
Veröffentlicht: (2023)
Dataflow-Aware PIM-Enabled Manycore Architecture for Deep Learning Workloads
von: Sharma, Harsh, et al.
Veröffentlicht: (2024)
von: Sharma, Harsh, et al.
Veröffentlicht: (2024)
FARe: Fault-Aware GNN Training on ReRAM-based PIM Accelerators
von: Dhingra, Pratyush, et al.
Veröffentlicht: (2024)
von: Dhingra, Pratyush, et al.
Veröffentlicht: (2024)
HePGA: A Heterogeneous Processing-in-Memory based GNN Training Accelerator
von: Ogbogu, Chukwufumnanya, et al.
Veröffentlicht: (2025)
von: Ogbogu, Chukwufumnanya, et al.
Veröffentlicht: (2025)
Designing High-Performance and Thermally Feasible Multi-Chiplet Architectures enabled by Non-bendable Glass Interposer
von: Sharma, Harsh, et al.
Veröffentlicht: (2025)
von: Sharma, Harsh, et al.
Veröffentlicht: (2025)
THERMOS: Thermally-Aware Multi-Objective Scheduling of AI Workloads on Heterogeneous Multi-Chiplet PIM Architectures
von: Kanani, Alish, et al.
Veröffentlicht: (2025)
von: Kanani, Alish, et al.
Veröffentlicht: (2025)
MFIT: Multi-Fidelity Thermal Modeling for 2.5D and 3D Multi-Chiplet Architectures
von: Pfromm, Lukas, et al.
Veröffentlicht: (2024)
von: Pfromm, Lukas, et al.
Veröffentlicht: (2024)
CHIPSIM: A Co-Simulation Framework for Deep Learning on Chiplet-Based Systems
von: Pfromm, Lukas, et al.
Veröffentlicht: (2025)
von: Pfromm, Lukas, et al.
Veröffentlicht: (2025)
Look-Up Table based Neural Network Hardware
von: Sen, Ovishake, et al.
Veröffentlicht: (2024)
von: Sen, Ovishake, et al.
Veröffentlicht: (2024)
COBRA: Algorithm-Architecture Co-optimized Binary Transformer Accelerator for Edge Inference
von: Qiao, Ye, et al.
Veröffentlicht: (2025)
von: Qiao, Ye, et al.
Veröffentlicht: (2025)
CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference
von: Chen, Yanru, et al.
Veröffentlicht: (2025)
von: Chen, Yanru, et al.
Veröffentlicht: (2025)
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
von: Yang, Xiaoxuan, et al.
Veröffentlicht: (2025)
von: Yang, Xiaoxuan, et al.
Veröffentlicht: (2025)
Toward Attention-based TinyML: A Heterogeneous Accelerated Architecture and Automated Deployment Flow
von: Wiese, Philip, et al.
Veröffentlicht: (2024)
von: Wiese, Philip, et al.
Veröffentlicht: (2024)
Accelerating PoT Quantization on Edge Devices
von: Saha, Rappy, et al.
Veröffentlicht: (2024)
von: Saha, Rappy, et al.
Veröffentlicht: (2024)
TrainDeeploy: Hardware-Accelerated Parameter-Efficient Fine-Tuning of Small Transformer Models at the Extreme Edge
von: Wang, Run, et al.
Veröffentlicht: (2026)
von: Wang, Run, et al.
Veröffentlicht: (2026)
Designing Efficient LLM Accelerators for Edge Devices
von: Haris, Jude, et al.
Veröffentlicht: (2024)
von: Haris, Jude, et al.
Veröffentlicht: (2024)
Accelerating Computer Architecture Simulation through Machine Learning
von: Ali, Wajid, et al.
Veröffentlicht: (2024)
von: Ali, Wajid, et al.
Veröffentlicht: (2024)
Enabling Physical AI at the Edge: Hardware-Accelerated Recovery of System Dynamics
von: Xu, Bin, et al.
Veröffentlicht: (2025)
von: Xu, Bin, et al.
Veröffentlicht: (2025)
Dynamic Tsetlin Machine Accelerators for On-Chip Training at the Edge using FPGAs
von: Mao, Gang, et al.
Veröffentlicht: (2025)
von: Mao, Gang, et al.
Veröffentlicht: (2025)
SeVeDo: A Heterogeneous Transformer Accelerator for Low-Bit Inference via Hierarchical Group Quantization and SVD-Guided Mixed Precision
von: Choi, Yuseon, et al.
Veröffentlicht: (2025)
von: Choi, Yuseon, et al.
Veröffentlicht: (2025)
SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
von: Liu, Qunyou, et al.
Veröffentlicht: (2026)
von: Liu, Qunyou, et al.
Veröffentlicht: (2026)
P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats
von: Chen, Yuzong, et al.
Veröffentlicht: (2025)
von: Chen, Yuzong, et al.
Veröffentlicht: (2025)
FLAASH: Flexible Accelerator Architecture for Sparse High-Order Tensor Contraction
von: Kulp, Gabriel, et al.
Veröffentlicht: (2024)
von: Kulp, Gabriel, et al.
Veröffentlicht: (2024)
EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture
von: Duan, Bowen, et al.
Veröffentlicht: (2026)
von: Duan, Bowen, et al.
Veröffentlicht: (2026)
TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs
von: Qiao, Ye, et al.
Veröffentlicht: (2025)
von: Qiao, Ye, et al.
Veröffentlicht: (2025)
AI Accelerators for Large Language Model Inference: Architecture Analysis and Scaling Strategies
von: Sharma, Amit
Veröffentlicht: (2025)
von: Sharma, Amit
Veröffentlicht: (2025)
H3DFact: Heterogeneous 3D Integrated CIM for Factorization with Holographic Perceptual Representations
von: Wan, Zishen, et al.
Veröffentlicht: (2024)
von: Wan, Zishen, et al.
Veröffentlicht: (2024)
Deeploy: Enabling Energy-Efficient Deployment of Small Language Models On Heterogeneous Microcontrollers
von: Scherer, Moritz, et al.
Veröffentlicht: (2024)
von: Scherer, Moritz, et al.
Veröffentlicht: (2024)
SHIELD: A Segmented Hierarchical Memory Architecture for Energy-Efficient LLM Inference on Edge NPUs
von: Zhang, Jintao, et al.
Veröffentlicht: (2026)
von: Zhang, Jintao, et al.
Veröffentlicht: (2026)
ITA: An Energy-Efficient Attention and Softmax Accelerator for Quantized Transformers
von: İslamoğlu, Gamze, et al.
Veröffentlicht: (2023)
von: İslamoğlu, Gamze, et al.
Veröffentlicht: (2023)
Sustainable Transformer Neural Network Acceleration with Stochastic Photonic Computing
von: Afifi, S., et al.
Veröffentlicht: (2026)
von: Afifi, S., et al.
Veröffentlicht: (2026)
An FPGA-Based Accelerator Enabling Efficient Support for CNNs with Arbitrary Kernel Sizes
von: Wang, Miaoxin, et al.
Veröffentlicht: (2024)
von: Wang, Miaoxin, et al.
Veröffentlicht: (2024)
Enabling Efficient Hybrid Systolic Computation in Shared L1-Memory Manycore Clusters
von: Mazzola, Sergio, et al.
Veröffentlicht: (2024)
von: Mazzola, Sergio, et al.
Veröffentlicht: (2024)
An Efficient Data Reuse with Tile-Based Adaptive Stationary for Transformer Accelerators
von: Li, Tseng-Jen, et al.
Veröffentlicht: (2025)
von: Li, Tseng-Jen, et al.
Veröffentlicht: (2025)
GFormer: Accelerating Large Language Models with Optimized Transformers on Gaudi Processors
von: Zhang, Chengming, et al.
Veröffentlicht: (2024)
von: Zhang, Chengming, et al.
Veröffentlicht: (2024)
An FPGA-Based Reconfigurable Accelerator for Convolution-Transformer Hybrid EfficientViT
von: Shao, Haikuo, et al.
Veröffentlicht: (2024)
von: Shao, Haikuo, et al.
Veröffentlicht: (2024)
The AetherFloat Family: Block-Scale-Free Quad-Radix Floating-Point Architectures for AI Accelerators
von: Morisaki, Keita
Veröffentlicht: (2026)
von: Morisaki, Keita
Veröffentlicht: (2026)
Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
von: Wolters, Christopher, et al.
Veröffentlicht: (2024)
von: Wolters, Christopher, et al.
Veröffentlicht: (2024)
GCoD: Graph Convolutional Network Acceleration via Dedicated Algorithm and Accelerator Co-Design
von: You, Haoran, et al.
Veröffentlicht: (2021)
von: You, Haoran, et al.
Veröffentlicht: (2021)
Ähnliche Einträge
-
HeTraX: Energy Efficient 3D Heterogeneous Manycore Architecture for Transformer Acceleration
von: Dhingra, Pratyush, et al.
Veröffentlicht: (2024) -
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
von: Sharma, Harsh, et al.
Veröffentlicht: (2023) -
Dataflow-Aware PIM-Enabled Manycore Architecture for Deep Learning Workloads
von: Sharma, Harsh, et al.
Veröffentlicht: (2024) -
FARe: Fault-Aware GNN Training on ReRAM-based PIM Accelerators
von: Dhingra, Pratyush, et al.
Veröffentlicht: (2024) -
HePGA: A Heterogeneous Processing-in-Memory based GNN Training Accelerator
von: Ogbogu, Chukwufumnanya, et al.
Veröffentlicht: (2025)