PacQ: A SIMT Microarchitecture for Efficient Dataflow in Hyper-asymmetric GEMMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Yin, Ruokai, Li, Yuhang, Panda, Priyadarshini |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LoAS: Fully Temporal-Parallel Dataflow for Dual-Sparse Spiking Neural Networks
di: Yin, Ruokai, et al.
Pubblicazione: (2024)
di: Yin, Ruokai, et al.
Pubblicazione: (2024)
DiffAxE: Diffusion-driven Hardware Accelerator Generation and Design Space Exploration
di: Ghosh, Arkapravo, et al.
Pubblicazione: (2025)
di: Ghosh, Arkapravo, et al.
Pubblicazione: (2025)
Banked Memories for Soft SIMT Processors
di: Langhammer, Martin, et al.
Pubblicazione: (2025)
di: Langhammer, Martin, et al.
Pubblicazione: (2025)
A 950 MHz SIMT Soft Processor
di: Langhammer, Martin, et al.
Pubblicazione: (2025)
di: Langhammer, Martin, et al.
Pubblicazione: (2025)
DICE: Enabling Efficient General-Purpose SIMT Execution with Statically Scheduled Coarse-Grained Reconfigurable Arrays
di: Wang, Jiayi, et al.
Pubblicazione: (2026)
di: Wang, Jiayi, et al.
Pubblicazione: (2026)
A Flexible Instruction Set Architecture for Efficient GEMMs
di: Santana, Alexandre de Limas, et al.
Pubblicazione: (2025)
di: Santana, Alexandre de Limas, et al.
Pubblicazione: (2025)
PIVOT- Input-aware Path Selection for Energy-efficient ViT Inference
di: Moitra, Abhishek, et al.
Pubblicazione: (2024)
di: Moitra, Abhishek, et al.
Pubblicazione: (2024)
MEADOW: Memory-efficient Dataflow and Data Packing for Low Power Edge LLMs
di: Moitra, Abhishek, et al.
Pubblicazione: (2025)
di: Moitra, Abhishek, et al.
Pubblicazione: (2025)
TReX- Reusing Vision Transformer's Attention for Efficient Xbar-based Computing
di: Moitra, Abhishek, et al.
Pubblicazione: (2024)
di: Moitra, Abhishek, et al.
Pubblicazione: (2024)
The Immutable Tensor Architecture: A Pure Dataflow Approach for Secure, Energy-Efficient AI Inference
di: Li, Fang
Pubblicazione: (2025)
di: Li, Fang
Pubblicazione: (2025)
LoopLynx: A Scalable Dataflow Architecture for Efficient LLM Inference
di: Zheng, Jianing, et al.
Pubblicazione: (2025)
di: Zheng, Jianing, et al.
Pubblicazione: (2025)
Benchmarking for Single Feature Attribution with Microarchitecture Cliffs
di: Zhen, Hao, et al.
Pubblicazione: (2026)
di: Zhen, Hao, et al.
Pubblicazione: (2026)
A Dataflow Compiler for Efficient LLM Inference using Custom Microscaling Formats
di: Cheng, Jianyi, et al.
Pubblicazione: (2023)
di: Cheng, Jianyi, et al.
Pubblicazione: (2023)
MIREDO: MIP-Driven Resource-Efficient Dataflow Optimization for Computing-in-Memory Accelerator
di: He, Xiaolin, et al.
Pubblicazione: (2025)
di: He, Xiaolin, et al.
Pubblicazione: (2025)
Revet: A Language and Compiler for Dataflow Threads
di: Rucker, Alexander, et al.
Pubblicazione: (2023)
di: Rucker, Alexander, et al.
Pubblicazione: (2023)
CODO: An Automated Compiler for Comprehensive Dataflow Optimization
di: Zhang, Weichuang, et al.
Pubblicazione: (2026)
di: Zhang, Weichuang, et al.
Pubblicazione: (2026)
A Composable Dynamic Sparse Dataflow Architecture for Efficient Event-based Vision Processing on FPGA
di: Gao, Yizhao, et al.
Pubblicazione: (2024)
di: Gao, Yizhao, et al.
Pubblicazione: (2024)
Hermes: A Unified High-Performance NTT Architecture with Hybrid Dataflow
di: Gu, Hang, et al.
Pubblicazione: (2026)
di: Gu, Hang, et al.
Pubblicazione: (2026)
VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator
di: Wang, Zhican, et al.
Pubblicazione: (2025)
di: Wang, Zhican, et al.
Pubblicazione: (2025)
A High-Throughput FPGA Accelerator for Lightweight CNNs With Balanced Dataflow
di: Zhao, Zhiyuan, et al.
Pubblicazione: (2024)
di: Zhao, Zhiyuan, et al.
Pubblicazione: (2024)
Automatic Microarchitecture-Aware Custom Instruction Design for RISC-V Processors
di: Rezunov, Evgenii, et al.
Pubblicazione: (2025)
di: Rezunov, Evgenii, et al.
Pubblicazione: (2025)
From Characterization to Microarchitecture: Designing an Elegant and Reliable BFP-Based NPU
di: Zhang, Jie, et al.
Pubblicazione: (2026)
di: Zhang, Jie, et al.
Pubblicazione: (2026)
Evaluating the Effectiveness of Microarchitectural Hardware Fault Detection for Application-Specific Requirements
di: Papadopoulos, Konstantinos-Nikolaos, et al.
Pubblicazione: (2024)
di: Papadopoulos, Konstantinos-Nikolaos, et al.
Pubblicazione: (2024)
AccelCIM: Systematic Dataflow Exploration for SRAM Compute-in-Memory Accelerator
di: Xue, Chenhao, et al.
Pubblicazione: (2026)
di: Xue, Chenhao, et al.
Pubblicazione: (2026)
Stream-HLS: Towards Automatic Dataflow Acceleration
di: Basalama, Suhail, et al.
Pubblicazione: (2025)
di: Basalama, Suhail, et al.
Pubblicazione: (2025)
Fast Cross-Operator Optimization of Attention Dataflow
di: Chang, Haodong, et al.
Pubblicazione: (2026)
di: Chang, Haodong, et al.
Pubblicazione: (2026)
SemanticBBV: A Semantic Signature for Cross-Program Knowledge Reuse in Microarchitecture Simulation
di: Liu, Zhenguo, et al.
Pubblicazione: (2025)
di: Liu, Zhenguo, et al.
Pubblicazione: (2025)
DataMaestro: A Versatile and Efficient Data Streaming Engine Bringing Decoupled Memory Access To Dataflow Accelerators
di: Yi, Xiaoling, et al.
Pubblicazione: (2025)
di: Yi, Xiaoling, et al.
Pubblicazione: (2025)
Multilayer Dataflow: Orchestrate Butterfly Sparsity to Accelerate Attention Computation
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
DORA: Dataflow-Instruction Orchestration Architecture for DNN Acceleration
di: Chen, Xingzhen, et al.
Pubblicazione: (2026)
di: Chen, Xingzhen, et al.
Pubblicazione: (2026)
A4: Microarchitecture-Aware LLC Management for Datacenter Servers with Emerging I/O Devices
di: Park, Haneul, et al.
Pubblicazione: (2025)
di: Park, Haneul, et al.
Pubblicazione: (2025)
SnipSnap: A Joint Compression Format and Dataflow Co-Optimization Framework for Efficient Sparse LLM Accelerator Design
di: Wu, Junyi, et al.
Pubblicazione: (2025)
di: Wu, Junyi, et al.
Pubblicazione: (2025)
FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
LP-Spec: Leveraging LPDDR PIM for Efficient LLM Mobile Speculative Inference with Architecture-Dataflow Co-Optimization
di: He, Siyuan, et al.
Pubblicazione: (2025)
di: He, Siyuan, et al.
Pubblicazione: (2025)
LLMulator: Generalizable Cost Modeling for Dataflow Accelerators with Input-Adaptive Control Flow
di: Chang, Kaiyan, et al.
Pubblicazione: (2025)
di: Chang, Kaiyan, et al.
Pubblicazione: (2025)
PyPIM: Integrating Digital Processing-in-Memory from Microarchitectural Design to Python Tensors
di: Leitersdorf, Orian, et al.
Pubblicazione: (2023)
di: Leitersdorf, Orian, et al.
Pubblicazione: (2023)
DAS-MP: Enabling High-Quality Macro Placement with Enhanced Dataflow Awareness
di: Zhao, Xiaotian, et al.
Pubblicazione: (2025)
di: Zhao, Xiaotian, et al.
Pubblicazione: (2025)
StreamTensor: Make Tensors Stream in Dataflow Accelerators for LLMs
di: Ye, Hanchen, et al.
Pubblicazione: (2025)
di: Ye, Hanchen, et al.
Pubblicazione: (2025)
Implementing and Optimizing the Scaled Dot-Product Attention on Streaming Dataflow
di: Sohn, Gina, et al.
Pubblicazione: (2024)
di: Sohn, Gina, et al.
Pubblicazione: (2024)
Supporting Secured Integration of Microarchitectural Defenses
di: Ramkrishnan, Kartik, et al.
Pubblicazione: (2026)
di: Ramkrishnan, Kartik, et al.
Pubblicazione: (2026)
Documenti analoghi
-
LoAS: Fully Temporal-Parallel Dataflow for Dual-Sparse Spiking Neural Networks
di: Yin, Ruokai, et al.
Pubblicazione: (2024) -
DiffAxE: Diffusion-driven Hardware Accelerator Generation and Design Space Exploration
di: Ghosh, Arkapravo, et al.
Pubblicazione: (2025) -
Banked Memories for Soft SIMT Processors
di: Langhammer, Martin, et al.
Pubblicazione: (2025) -
A 950 MHz SIMT Soft Processor
di: Langhammer, Martin, et al.
Pubblicazione: (2025) -
DICE: Enabling Efficient General-Purpose SIMT Execution with Statically Scheduled Coarse-Grained Reconfigurable Arrays
di: Wang, Jiayi, et al.
Pubblicazione: (2026)