Efficient deadlock avoidance for 2D mesh NoCs that use OQ or VOQ routers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Papaphilippou, Philippos, Van Chu, Thiem |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Lightweight High-Throughput Collective-Capable NoC for Large-Scale ML Accelerators
par: Colagrande, Luca, et autres
Publié: (2026)
par: Colagrande, Luca, et autres
Publié: (2026)
Deadlock-free routing for Full-mesh networks without using Virtual Channels
par: Cano, Alejandro, et autres
Publié: (2025)
par: Cano, Alejandro, et autres
Publié: (2025)
Optimizing Offload Performance in Heterogeneous MPSoCs
par: Colagrande, Luca, et autres
Publié: (2024)
par: Colagrande, Luca, et autres
Publié: (2024)
XDMA: A Distributed, Extensible DMA Architecture for Layout-Flexible Data Movements in Heterogeneous Multi-Accelerator SoCs
par: Kong, Fanchen, et autres
Publié: (2025)
par: Kong, Fanchen, et autres
Publié: (2025)
SpArch: Efficient Architecture for Sparse Matrix Multiplication
par: Zhang, Zhekai, et autres
Publié: (2020)
par: Zhang, Zhekai, et autres
Publié: (2020)
Efficient Architecture for RISC-V Vector Memory Access
par: Guan, Hongyi, et autres
Publié: (2025)
par: Guan, Hongyi, et autres
Publié: (2025)
Understanding Bottlenecks for Efficiently Serving LLM Inference With KV Offloading
par: Meng, William, et autres
Publié: (2025)
par: Meng, William, et autres
Publié: (2025)
Tascade: Hardware Support for Atomic-free, Asynchronous and Efficient Reduction Trees
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
Torrent: A Distributed DMA for Efficient and Flexible Point-to-Multipoint Data Movement
par: Deng, Yunhao, et autres
Publié: (2025)
par: Deng, Yunhao, et autres
Publié: (2025)
UniFormer: Unified and Efficient Transformer for Reasoning Across General and Custom Computing
par: Ran, Zhuoheng, et autres
Publié: (2025)
par: Ran, Zhuoheng, et autres
Publié: (2025)
PAM: Processing Across Memory Hierarchy for Efficient KV-centric LLM Serving System
par: Liu, Lian, et autres
Publié: (2026)
par: Liu, Lian, et autres
Publié: (2026)
Efficient MoE Serving in the Memory-Bound Regime: Balance Activated Experts, Not Tokens
par: Yu, Yanpeng, et autres
Publié: (2025)
par: Yu, Yanpeng, et autres
Publié: (2025)
Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache
par: Lin, Bin, et autres
Publié: (2024)
par: Lin, Bin, et autres
Publié: (2024)
DiP: A Scalable, Energy-Efficient Systolic Array for Matrix Multiplication Acceleration
par: Abdelmaksoud, Ahmed J., et autres
Publié: (2024)
par: Abdelmaksoud, Ahmed J., et autres
Publié: (2024)
EDEA: Efficient Dual-Engine Accelerator for Depthwise Separable Convolution with Direct Data Transfer
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
Generic and ML Workloads in an HPC Datacenter: Node Energy, Job Failures, and Node-Job Analysis
par: Chu, Xiaoyu, et autres
Publié: (2024)
par: Chu, Xiaoyu, et autres
Publié: (2024)
TT-Edge: A Hardware-Software Co-Design for Energy-Efficient Tensor-Train Decomposition on Edge AI
par: Kwak, Hyunseok, et autres
Publié: (2025)
par: Kwak, Hyunseok, et autres
Publié: (2025)
Accelerating Data Chunking in Deduplication Systems using Vector Instructions
par: Udayashankar, Sreeharsha, et autres
Publié: (2025)
par: Udayashankar, Sreeharsha, et autres
Publié: (2025)
CMDS: Cross-layer Dataflow Optimization for DNN Accelerators Exploiting Multi-bank Memories
par: Shi, Man, et autres
Publié: (2024)
par: Shi, Man, et autres
Publié: (2024)
Pooling Engram Conditional Memory in Large Language Models using CXL
par: Ma, Ruiyang, et autres
Publié: (2026)
par: Ma, Ruiyang, et autres
Publié: (2026)
MATCHA: Efficient Deployment of Deep Neural Networks on Multi-Accelerator Heterogeneous Edge SoCs
par: Russo, Enrico, et autres
Publié: (2026)
par: Russo, Enrico, et autres
Publié: (2026)
Exploring the Efficiency of 3D-Stacked AI Chip Architecture for LLM Inference with Voxel
par: Liu, Yiqi, et autres
Publié: (2026)
par: Liu, Yiqi, et autres
Publié: (2026)
MIMDRAM: An End-to-End Processing-Using-DRAM System for High-Throughput, Energy-Efficient and Programmer-Transparent Multiple-Instruction Multiple-Data Processing
par: Oliveira, Geraldo F., et autres
Publié: (2024)
par: Oliveira, Geraldo F., et autres
Publié: (2024)
Next-generation Probabilistic Computing Hardware with 3D MOSAICs, Illusion Scale-up, and Co-design
par: Srimani, Tathagata, et autres
Publié: (2024)
par: Srimani, Tathagata, et autres
Publié: (2024)
DeepStack: Scalable and Accurate Design Space Exploration for Distributed 3D-Stacked AI Accelerators
par: Mo, Zhiwen, et autres
Publié: (2026)
par: Mo, Zhiwen, et autres
Publié: (2026)
RevaMp3D: Architecting the Processor Core and Cache Hierarchy for Systems with Monolithically-Integrated Logic and Memory
par: Ghiasi, Nika Mansouri, et autres
Publié: (2022)
par: Ghiasi, Nika Mansouri, et autres
Publié: (2022)
Evaluation of computational and energy performance in matrix multiplication algorithms on CPU and GPU using MKL, cuBLAS and SYCL
par: Torres, L. A., et autres
Publié: (2024)
par: Torres, L. A., et autres
Publié: (2024)
HgPCN: A Heterogeneous Architecture for E2E Embedded Point Cloud Inference
par: Gao, Yiming, et autres
Publié: (2025)
par: Gao, Yiming, et autres
Publié: (2025)
Cloud-Native Operation of Roadside Infrastructure Enabling Demand-Driven Collective Perception via V2X
par: Zanger, Lukas, et autres
Publié: (2026)
par: Zanger, Lukas, et autres
Publié: (2026)
An Evaluation and Comparison of GPU Hardware and Solver Libraries for Accelerating the OPM Flow Reservoir Simulator
par: Qiu, Tong Dong, et autres
Publié: (2023)
par: Qiu, Tong Dong, et autres
Publié: (2023)
DCRA: A Distributed Chiplet-based Reconfigurable Architecture for Irregular Applications
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
PULSAR: Simultaneous Many-Row Activation for Reliable and High-Performance Computing in Off-the-Shelf DRAM Chips
par: Yuksel, Ismail Emir, et autres
Publié: (2023)
par: Yuksel, Ismail Emir, et autres
Publié: (2023)
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
par: Sharma, Harsh, et autres
Publié: (2023)
par: Sharma, Harsh, et autres
Publié: (2023)
CELLO: Co-designing Schedule and Hybrid Implicit/Explicit Buffer for Complex Tensor Reuse
par: Garg, Raveesh, et autres
Publié: (2023)
par: Garg, Raveesh, et autres
Publié: (2023)
Optimizing Distributed ML Communication with Fused Computation-Collective Operations
par: Punniyamurthy, Kishore, et autres
Publié: (2023)
par: Punniyamurthy, Kishore, et autres
Publié: (2023)
TAPA-CS: Enabling Scalable Accelerator Design on Distributed HBM-FPGAs
par: Prakriya, Neha, et autres
Publié: (2023)
par: Prakriya, Neha, et autres
Publié: (2023)
Part-time Power Measurements: nvidia-smi's Lack of Attention
par: Yang, Zeyu, et autres
Publié: (2023)
par: Yang, Zeyu, et autres
Publié: (2023)
Muchisim: A Simulation Framework for Design Exploration of Multi-Chip Manycore Systems
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
The DEEP-ER project: I/O and resiliency extensions for the Cluster-Booster architecture
par: Kreuzer, Anke, et autres
Publié: (2019)
par: Kreuzer, Anke, et autres
Publié: (2019)
SLIM: A Heterogeneous Accelerator for Edge Inference of Sparse Large Language Model via Adaptive Thresholding
par: Xu, Weihong, et autres
Publié: (2025)
par: Xu, Weihong, et autres
Publié: (2025)
Documents similaires
-
A Lightweight High-Throughput Collective-Capable NoC for Large-Scale ML Accelerators
par: Colagrande, Luca, et autres
Publié: (2026) -
Deadlock-free routing for Full-mesh networks without using Virtual Channels
par: Cano, Alejandro, et autres
Publié: (2025) -
Optimizing Offload Performance in Heterogeneous MPSoCs
par: Colagrande, Luca, et autres
Publié: (2024) -
XDMA: A Distributed, Extensible DMA Architecture for Layout-Flexible Data Movements in Heterogeneous Multi-Accelerator SoCs
par: Kong, Fanchen, et autres
Publié: (2025) -
SpArch: Efficient Architecture for Sparse Matrix Multiplication
par: Zhang, Zhekai, et autres
Publié: (2020)