PipeOrgan: Efficient Inter-operation Pipelining with Flexible Spatial Organization and Interconnects
Fuente:
arXiv
Salvato in:
| Autori principali: | Garg, Raveesh, Kwon, Hyoukjun, Qin, Eric, Chen, Yu-Hsin, Krishna, Tushar, Lai, Liangzhen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HARP: A Taxonomy for Heterogeneous and Hierarchical Processors for Mixed-reuse Workloads
di: Garg, Raveesh, et al.
Pubblicazione: (2025)
di: Garg, Raveesh, et al.
Pubblicazione: (2025)
CELLO: Co-designing Schedule and Hybrid Implicit/Explicit Buffer for Complex Tensor Reuse
di: Garg, Raveesh, et al.
Pubblicazione: (2023)
di: Garg, Raveesh, et al.
Pubblicazione: (2023)
Optimized Spatial Architecture Mapping Flow for Transformer Accelerators
di: Xu, Haocheng, et al.
Pubblicazione: (2024)
di: Xu, Haocheng, et al.
Pubblicazione: (2024)
FRED: Flexible REduction-Distribution Interconnect and Communication Implementation for Wafer-Scale Distributed Training of DNN Models
di: Rashidi, Saeed, et al.
Pubblicazione: (2024)
di: Rashidi, Saeed, et al.
Pubblicazione: (2024)
PlaceIT: Placement-based Inter-Chiplet Interconnect Topologies
di: Iff, Patrick, et al.
Pubblicazione: (2025)
di: Iff, Patrick, et al.
Pubblicazione: (2025)
Scalable and Efficient Intra- and Inter-node Interconnection Networks for Post-Exascale Supercomputers and Data centers
di: Tarraga-Moreno, Joaquin, et al.
Pubblicazione: (2025)
di: Tarraga-Moreno, Joaquin, et al.
Pubblicazione: (2025)
PipeRTL: Timing-Aware Pipeline Optimization at IR-Level for RTL Generation
di: Yin, Shuo, et al.
Pubblicazione: (2026)
di: Yin, Shuo, et al.
Pubblicazione: (2026)
FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression
di: Qiao, Ye, et al.
Pubblicazione: (2026)
di: Qiao, Ye, et al.
Pubblicazione: (2026)
Understanding the Performance Horizon of the Latest ML Workloads with NonGEMM Workloads
di: Karami, Rachid, et al.
Pubblicazione: (2024)
di: Karami, Rachid, et al.
Pubblicazione: (2024)
FoldedHexaTorus: An Inter-Chiplet Interconnect Topology for Chiplet-based Systems using Organic and Glass Substrates
di: Iff, Patrick, et al.
Pubblicazione: (2025)
di: Iff, Patrick, et al.
Pubblicazione: (2025)
METRO: A Software-Hardware Co-Design of Interconnections for Spatial DNN Accelerators
di: Wang, Zhao, et al.
Pubblicazione: (2021)
di: Wang, Zhao, et al.
Pubblicazione: (2021)
Axon: A novel systolic array architecture for improved run time and energy efficient GeMM and Conv operation with on-chip im2col
di: Nayan, Md Mizanur Rahaman, et al.
Pubblicazione: (2025)
di: Nayan, Md Mizanur Rahaman, et al.
Pubblicazione: (2025)
FEATHER: A Reconfigurable Accelerator with Data Reordering Support for Low-Cost On-Chip Dataflow Switching
di: Tong, Jianming, et al.
Pubblicazione: (2024)
di: Tong, Jianming, et al.
Pubblicazione: (2024)
MCMComm: Hardware-Software Co-Optimization for End-to-End Communication in Multi-Chip-Modules
di: Raj, Ritik, et al.
Pubblicazione: (2025)
di: Raj, Ritik, et al.
Pubblicazione: (2025)
D-com: Accelerating Iterative Processing to Enable Low-rank Decomposition of Activations
di: Tahmasebi, Faraz, et al.
Pubblicazione: (2025)
di: Tahmasebi, Faraz, et al.
Pubblicazione: (2025)
CogSys: Efficient and Scalable Neurosymbolic Cognition System via Algorithm-Hardware Co-Design
di: Wan, Zishen, et al.
Pubblicazione: (2025)
di: Wan, Zishen, et al.
Pubblicazione: (2025)
Link Quality Aware Pathfinding for Chiplet Interconnects
di: Yen, Aaron, et al.
Pubblicazione: (2026)
di: Yen, Aaron, et al.
Pubblicazione: (2026)
Interconnect-Aware Logic Resynthesis for Multi-Die FPGAs
di: Wang, Xiaoke, et al.
Pubblicazione: (2026)
di: Wang, Xiaoke, et al.
Pubblicazione: (2026)
Neuromorphic Processor Employing FPGA Technology with Universal Interconnections
di: Harlikar, Pracheta, et al.
Pubblicazione: (2025)
di: Harlikar, Pracheta, et al.
Pubblicazione: (2025)
Sim-FA: A GPGPU Simulator Framework for Fine-Grained FlashAttention Pipeline Analysis
di: Zhou, Zhongchun, et al.
Pubblicazione: (2026)
di: Zhou, Zhongchun, et al.
Pubblicazione: (2026)
LEXI: Lossless Exponent Coding for Efficient Inter-Chiplet Communication in Hybrid LLMs
di: Sun, Miao, et al.
Pubblicazione: (2026)
di: Sun, Miao, et al.
Pubblicazione: (2026)
SCALE-Sim TPU: Validating and Extending SCALE-Sim for TPUs
di: Dang, Jingtian, et al.
Pubblicazione: (2026)
di: Dang, Jingtian, et al.
Pubblicazione: (2026)
A Hybrid Delay Model for Interconnected Multi-Input Gates
di: Ferdowsi, Arman, et al.
Pubblicazione: (2024)
di: Ferdowsi, Arman, et al.
Pubblicazione: (2024)
Efficient Tabular Data Preprocessing of ML Pipelines
di: Zhu, Yu, et al.
Pubblicazione: (2024)
di: Zhu, Yu, et al.
Pubblicazione: (2024)
SPRING: Systematic Profiling of Randomly Interconnected Neural Networks Generated by HLS
di: Shi, Rui, et al.
Pubblicazione: (2025)
di: Shi, Rui, et al.
Pubblicazione: (2025)
Designing Reconfigurable Interconnection Network of Heterogeneous Chiplets Using Kalman Filter
di: Biglari, Siamak, et al.
Pubblicazione: (2024)
di: Biglari, Siamak, et al.
Pubblicazione: (2024)
On the Impact of Intra-node Communication in the Performance of Supercomputer and Data Center Interconnection Networks
di: Tarraga-Moreno, Joaquin, et al.
Pubblicazione: (2025)
di: Tarraga-Moreno, Joaquin, et al.
Pubblicazione: (2025)
A Linear-Time Algorithm for Steady-State Analysis of Electromigration in General Interconnects
di: Shohel, Mohammad Abdullah Al, et al.
Pubblicazione: (2021)
di: Shohel, Mohammad Abdullah Al, et al.
Pubblicazione: (2021)
VR-Pipe: Streamlining Hardware Graphics Pipeline for Volume Rendering
di: Lee, Junseo, et al.
Pubblicazione: (2025)
di: Lee, Junseo, et al.
Pubblicazione: (2025)
Sustainable operation of research infrastructure for novel computing
di: Stradmann, Yannik, et al.
Pubblicazione: (2025)
di: Stradmann, Yannik, et al.
Pubblicazione: (2025)
ChipLight: Cross-Layer Optimization of Chiplet Design with Optical Interconnects for LLM Training
di: Bai, Kangbo, et al.
Pubblicazione: (2026)
di: Bai, Kangbo, et al.
Pubblicazione: (2026)
relOBI: A Reliable Low-latency Interconnect for Tightly-Coupled On-chip Communication
di: Rogenmoser, Michael, et al.
Pubblicazione: (2025)
di: Rogenmoser, Michael, et al.
Pubblicazione: (2025)
Best Practices for Large Load Interconnections: A North American Perspective on Data Centers
di: Zahedi, Rafi, et al.
Pubblicazione: (2026)
di: Zahedi, Rafi, et al.
Pubblicazione: (2026)
Fault Injection in On-Chip Interconnects: A Comparative Study of Wishbone, AXI-Lite, and AXI
di: Zhao, Hongwei, et al.
Pubblicazione: (2025)
di: Zhao, Hongwei, et al.
Pubblicazione: (2025)
FETTA: Flexible and Efficient Hardware Accelerator for Tensorized Neural Network Training
di: Lu, Jinming, et al.
Pubblicazione: (2025)
di: Lu, Jinming, et al.
Pubblicazione: (2025)
Characterizing State Space Model and Hybrid Language Model Performance with Long Context
di: Mitra, Saptarshi, et al.
Pubblicazione: (2025)
di: Mitra, Saptarshi, et al.
Pubblicazione: (2025)
FlexiBit: Fully Flexible Precision Bit-parallel Accelerator Architecture for Arbitrary Mixed Precision AI
di: Tahmasebi, Faraz, et al.
Pubblicazione: (2024)
di: Tahmasebi, Faraz, et al.
Pubblicazione: (2024)
The BrainScaleS-2 multi-chip system: Interconnecting continuous-time neuromorphic compute substrates
di: Ilmberger, Joscha, et al.
Pubblicazione: (2025)
di: Ilmberger, Joscha, et al.
Pubblicazione: (2025)
PICNIC: Silicon Photonic Interconnected Chiplets with Computational Network and In-memory Computing for LLM Inference Acceleration
di: Chong, Yue Jiet, et al.
Pubblicazione: (2025)
di: Chong, Yue Jiet, et al.
Pubblicazione: (2025)
Switch-Less Dragonfly on Wafers: A Scalable Interconnection Architecture based on Wafer-Scale Integration
di: Feng, Yinxiao, et al.
Pubblicazione: (2024)
di: Feng, Yinxiao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
HARP: A Taxonomy for Heterogeneous and Hierarchical Processors for Mixed-reuse Workloads
di: Garg, Raveesh, et al.
Pubblicazione: (2025) -
CELLO: Co-designing Schedule and Hybrid Implicit/Explicit Buffer for Complex Tensor Reuse
di: Garg, Raveesh, et al.
Pubblicazione: (2023) -
Optimized Spatial Architecture Mapping Flow for Transformer Accelerators
di: Xu, Haocheng, et al.
Pubblicazione: (2024) -
FRED: Flexible REduction-Distribution Interconnect and Communication Implementation for Wafer-Scale Distributed Training of DNN Models
di: Rashidi, Saeed, et al.
Pubblicazione: (2024) -
PlaceIT: Placement-based Inter-Chiplet Interconnect Topologies
di: Iff, Patrick, et al.
Pubblicazione: (2025)