Performance Modeling and Workload Analysis of Distributed Large Language Model Training and Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kundu, Joyjit, Guo, Wenzhe, BanaGozar, Ali, De Alwis, Udari, Sengupta, Sourav, Gupta, Puneet, Mallik, Arindam |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Workload-Aware Hardware Accelerator Mining for Distributed Deep Learning Training
par: Adnan, Muhammad, et autres
Publié: (2024)
par: Adnan, Muhammad, et autres
Publié: (2024)
Profiling Concurrent Vision Inference Workloads on NVIDIA Jetson -- Extended
par: Chakraborty, Abhinaba, et autres
Publié: (2025)
par: Chakraborty, Abhinaba, et autres
Publié: (2025)
Characterizing and Optimizing LLM Inference Workloads on CPU-GPU Coupled Architectures
par: Vellaisamy, Prabhu, et autres
Publié: (2025)
par: Vellaisamy, Prabhu, et autres
Publié: (2025)
Data-aware Dynamic Execution of Irregular Workloads on Heterogeneous Systems
par: Bai, Zhenyu, et autres
Publié: (2025)
par: Bai, Zhenyu, et autres
Publié: (2025)
HARP: A Taxonomy for Heterogeneous and Hierarchical Processors for Mixed-reuse Workloads
par: Garg, Raveesh, et autres
Publié: (2025)
par: Garg, Raveesh, et autres
Publié: (2025)
Automated Deep Neural Network Inference Partitioning for Distributed Embedded Systems
par: Kreß, Fabian, et autres
Publié: (2024)
par: Kreß, Fabian, et autres
Publié: (2024)
Generic and ML Workloads in an HPC Datacenter: Node Energy, Job Failures, and Node-Job Analysis
par: Chu, Xiaoyu, et autres
Publié: (2024)
par: Chu, Xiaoyu, et autres
Publié: (2024)
Implementation and Evaluation of GBDI Memory Compression Algorithm Using C/C++ on a Broader Range of Workloads
par: Aina, Adeyemi
Publié: (2025)
par: Aina, Adeyemi
Publié: (2025)
SLIM: A Heterogeneous Accelerator for Edge Inference of Sparse Large Language Model via Adaptive Thresholding
par: Xu, Weihong, et autres
Publié: (2025)
par: Xu, Weihong, et autres
Publié: (2025)
FengHuang: Next-Generation Memory Orchestration for AI Inferencing
par: Li, Jiamin, et autres
Publié: (2025)
par: Li, Jiamin, et autres
Publié: (2025)
Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference
par: Chung, Euijun, et autres
Publié: (2026)
par: Chung, Euijun, et autres
Publié: (2026)
Understanding Bottlenecks for Efficiently Serving LLM Inference With KV Offloading
par: Meng, William, et autres
Publié: (2025)
par: Meng, William, et autres
Publié: (2025)
Fusing Depthwise and Pointwise Convolutions for Efficient Inference on GPUs
par: Qararyah, Fareed, et autres
Publié: (2024)
par: Qararyah, Fareed, et autres
Publié: (2024)
Exploring the Efficiency of 3D-Stacked AI Chip Architecture for LLM Inference with Voxel
par: Liu, Yiqi, et autres
Publié: (2026)
par: Liu, Yiqi, et autres
Publié: (2026)
DP-HLS: A High-Level Synthesis Framework for Accelerating Dynamic Programming Algorithms in Bioinformatics
par: Cao, Yingqi, et autres
Publié: (2024)
par: Cao, Yingqi, et autres
Publié: (2024)
HgPCN: A Heterogeneous Architecture for E2E Embedded Point Cloud Inference
par: Gao, Yiming, et autres
Publié: (2025)
par: Gao, Yiming, et autres
Publié: (2025)
Navigating the Landscape of Distributed File Systems: Architectures, Implementations, and Considerations
par: Pan, Xueting, et autres
Publié: (2024)
par: Pan, Xueting, et autres
Publié: (2024)
Optimizing Distributed ML Communication with Fused Computation-Collective Operations
par: Punniyamurthy, Kishore, et autres
Publié: (2023)
par: Punniyamurthy, Kishore, et autres
Publié: (2023)
DCRA: A Distributed Chiplet-based Reconfigurable Architecture for Irregular Applications
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
TAPA-CS: Enabling Scalable Accelerator Design on Distributed HBM-FPGAs
par: Prakriya, Neha, et autres
Publié: (2023)
par: Prakriya, Neha, et autres
Publié: (2023)
Chopper: A Multi-Level GPU Characterization Tool & Derived Insights Into LLM Training Inefficiency
par: Kurzynski, Marco, et autres
Publié: (2025)
par: Kurzynski, Marco, et autres
Publié: (2025)
Enabling Time-Aware Priority Traffic Management over Distributed FPGA Nodes
par: Scionti, Alberto, et autres
Publié: (2025)
par: Scionti, Alberto, et autres
Publié: (2025)
Torrent: A Distributed DMA for Efficient and Flexible Point-to-Multipoint Data Movement
par: Deng, Yunhao, et autres
Publié: (2025)
par: Deng, Yunhao, et autres
Publié: (2025)
COMET: A Framework for Modeling Compound Operation Dataflows with Explicit Collectives
par: Negi, Shubham, et autres
Publié: (2025)
par: Negi, Shubham, et autres
Publié: (2025)
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
par: Sharma, Harsh, et autres
Publié: (2023)
par: Sharma, Harsh, et autres
Publié: (2023)
Microbenchmark-Driven Analytical Performance Modeling Across Modern GPU Architectures
par: Jarmusch, Aaron, et autres
Publié: (2026)
par: Jarmusch, Aaron, et autres
Publié: (2026)
Pooling Engram Conditional Memory in Large Language Models using CXL
par: Ma, Ruiyang, et autres
Publié: (2026)
par: Ma, Ruiyang, et autres
Publié: (2026)
New Tools, Programming Models, and System Support for Processing-in-Memory Architectures
par: Oliveira, Geraldo F.
Publié: (2025)
par: Oliveira, Geraldo F.
Publié: (2025)
Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache
par: Lin, Bin, et autres
Publié: (2024)
par: Lin, Bin, et autres
Publié: (2024)
Enhancing Regression Models for Complex Systems Using Evolutionary Techniques for Feature Engineering
par: Arroba, Patricia, et autres
Publié: (2024)
par: Arroba, Patricia, et autres
Publié: (2024)
TT-Edge: A Hardware-Software Co-Design for Energy-Efficient Tensor-Train Decomposition on Edge AI
par: Kwak, Hyunseok, et autres
Publié: (2025)
par: Kwak, Hyunseok, et autres
Publié: (2025)
Scheduling Techniques of AI Models on Modern Heterogeneous Edge GPU -- A Critical Review
par: Majeed, Ashiyana Abdul, et autres
Publié: (2025)
par: Majeed, Ashiyana Abdul, et autres
Publié: (2025)
EPOCH: Enabling Preemption Operation for Context Saving in Heterogeneous FPGA Systems
par: Malik, Arsalan Ali, et autres
Publié: (2025)
par: Malik, Arsalan Ali, et autres
Publié: (2025)
DeepStack: Scalable and Accurate Design Space Exploration for Distributed 3D-Stacked AI Accelerators
par: Mo, Zhiwen, et autres
Publié: (2026)
par: Mo, Zhiwen, et autres
Publié: (2026)
GreenLLM: Disaggregating Large Language Model Serving on Heterogeneous GPUs for Lower Carbon Emissions
par: Shi, Tianyao, et autres
Publié: (2024)
par: Shi, Tianyao, et autres
Publié: (2024)
Cache Your Prompt When It's Green: Carbon-Aware Caching for Large Language Model Serving
par: Tian, Yuyang, et autres
Publié: (2025)
par: Tian, Yuyang, et autres
Publié: (2025)
XDMA: A Distributed, Extensible DMA Architecture for Layout-Flexible Data Movements in Heterogeneous Multi-Accelerator SoCs
par: Kong, Fanchen, et autres
Publié: (2025)
par: Kong, Fanchen, et autres
Publié: (2025)
DeFiNES: Enabling Fast Exploration of the Depth-first Scheduling Space for DNN Accelerators through Analytical Modeling
par: Mei, Linyan, et autres
Publié: (2022)
par: Mei, Linyan, et autres
Publié: (2022)
NPU Design for Diffusion Language Model Inference
par: Lou, Binglei, et autres
Publié: (2026)
par: Lou, Binglei, et autres
Publié: (2026)
Conduit: Programmer-Transparent Near-Data Processing Using Multiple Compute-Capable Resources in Solid State Drives
par: Nadig, Rakesh, et autres
Publié: (2026)
par: Nadig, Rakesh, et autres
Publié: (2026)
Documents similaires
-
Workload-Aware Hardware Accelerator Mining for Distributed Deep Learning Training
par: Adnan, Muhammad, et autres
Publié: (2024) -
Profiling Concurrent Vision Inference Workloads on NVIDIA Jetson -- Extended
par: Chakraborty, Abhinaba, et autres
Publié: (2025) -
Characterizing and Optimizing LLM Inference Workloads on CPU-GPU Coupled Architectures
par: Vellaisamy, Prabhu, et autres
Publié: (2025) -
Data-aware Dynamic Execution of Irregular Workloads on Heterogeneous Systems
par: Bai, Zhenyu, et autres
Publié: (2025) -
HARP: A Taxonomy for Heterogeneous and Hierarchical Processors for Mixed-reuse Workloads
par: Garg, Raveesh, et autres
Publié: (2025)