An Explorative Study on Distributed Computing Techniques in Training and Inference of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Hakim, Sheikh Azizul, Hasan, Saem |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities
di: Chen, Zhixiong, et al.
Pubblicazione: (2026)
di: Chen, Zhixiong, et al.
Pubblicazione: (2026)
TokenSim: Enabling Hardware and Software Exploration for Large Language Model Inference Systems
di: Wu, Feiyang, et al.
Pubblicazione: (2025)
di: Wu, Feiyang, et al.
Pubblicazione: (2025)
Characterizing Communication Patterns in Distributed Large Language Model Inference
di: Xu, Lang, et al.
Pubblicazione: (2025)
di: Xu, Lang, et al.
Pubblicazione: (2025)
Efficient Training of Large Language Models on Distributed Infrastructures: A Survey
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
Galvatron: Automatic Distributed Training for Large Transformer Models
di: Gumaan, Esmail
Pubblicazione: (2025)
di: Gumaan, Esmail
Pubblicazione: (2025)
Accelerating Distributed MoE Training and Inference with Lina
di: Li, Jiamin, et al.
Pubblicazione: (2022)
di: Li, Jiamin, et al.
Pubblicazione: (2022)
Distributed On-Device LLM Inference With Over-the-Air Computation
di: Zhang, Kai, et al.
Pubblicazione: (2025)
di: Zhang, Kai, et al.
Pubblicazione: (2025)
SLO-Aware Scheduling for Large Language Model Inferences
di: Huang, Jinqi, et al.
Pubblicazione: (2025)
di: Huang, Jinqi, et al.
Pubblicazione: (2025)
SPIN: Accelerating Large Language Model Inference with Heterogeneous Speculative Models
di: Chen, Fahao, et al.
Pubblicazione: (2025)
di: Chen, Fahao, et al.
Pubblicazione: (2025)
Fast Distributed Inference Serving for Large Language Models
di: Wu, Bingyang, et al.
Pubblicazione: (2023)
di: Wu, Bingyang, et al.
Pubblicazione: (2023)
DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models
di: Zhang, Zili, et al.
Pubblicazione: (2024)
di: Zhang, Zili, et al.
Pubblicazione: (2024)
Memory Offloading for Large Language Model Inference with Latency SLO Guarantees
di: Ma, Chenxiang, et al.
Pubblicazione: (2025)
di: Ma, Chenxiang, et al.
Pubblicazione: (2025)
Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution
di: Wang, Siqi, et al.
Pubblicazione: (2024)
di: Wang, Siqi, et al.
Pubblicazione: (2024)
OpenDC-STEAM: Realistic Modeling and Systematic Exploration of Composable Techniques for Sustainable Datacenters
di: Niewenhuis, Dante, et al.
Pubblicazione: (2026)
di: Niewenhuis, Dante, et al.
Pubblicazione: (2026)
λScale: Enabling Fast Scaling for Serverless Large Language Model Inference
di: Yu, Minchen, et al.
Pubblicazione: (2025)
di: Yu, Minchen, et al.
Pubblicazione: (2025)
HexGen: Generative Inference of Large Language Model over Heterogeneous Environment
di: Jiang, Youhe, et al.
Pubblicazione: (2023)
di: Jiang, Youhe, et al.
Pubblicazione: (2023)
PRISM: Probabilistic Runtime Insights and Scalable Performance Modeling for Large-Scale Distributed Training
di: Golden, Alicia, et al.
Pubblicazione: (2025)
di: Golden, Alicia, et al.
Pubblicazione: (2025)
Lagom: Unleashing the Power of Communication and Computation Overlapping for Distributed LLM Training
di: Xu, Guanbin, et al.
Pubblicazione: (2026)
di: Xu, Guanbin, et al.
Pubblicazione: (2026)
PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications
di: Du, Kuntai, et al.
Pubblicazione: (2025)
di: Du, Kuntai, et al.
Pubblicazione: (2025)
HexiScale: Facilitating Large Language Model Training over Heterogeneous Hardware
di: Yan, Ran, et al.
Pubblicazione: (2024)
di: Yan, Ran, et al.
Pubblicazione: (2024)
An Engineering Journey Training Large Language Models at Scale on Alps: The Apertus Experience
di: Coles, Jonathan, et al.
Pubblicazione: (2026)
di: Coles, Jonathan, et al.
Pubblicazione: (2026)
Disaggregated Prefill and Decoding Inference System for Large Language Model Serving on Multi-Vendor GPUs
di: Chen, Xing, et al.
Pubblicazione: (2025)
di: Chen, Xing, et al.
Pubblicazione: (2025)
SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference
di: Zhao, Yihao, et al.
Pubblicazione: (2025)
di: Zhao, Yihao, et al.
Pubblicazione: (2025)
Comparative Study of Large Language Model Architectures on Frontier
di: Yin, Junqi, et al.
Pubblicazione: (2024)
di: Yin, Junqi, et al.
Pubblicazione: (2024)
SpecInF: Exploiting Idle GPU Resources in Distributed DL Training via Speculative Inference Filling
di: Lv, Cunchi, et al.
Pubblicazione: (2025)
di: Lv, Cunchi, et al.
Pubblicazione: (2025)
Performance Modeling and Workload Analysis of Distributed Large Language Model Training and Inference
di: Kundu, Joyjit, et al.
Pubblicazione: (2024)
di: Kundu, Joyjit, et al.
Pubblicazione: (2024)
On the Performance and Memory Footprint of Distributed Training: An Empirical Study on Transformers
di: Lu, Zhengxian, et al.
Pubblicazione: (2024)
di: Lu, Zhengxian, et al.
Pubblicazione: (2024)
FFTrainer: Fast Failover in Large-Language Model Training with Almost-Free State Management
di: Zhao, Bohan, et al.
Pubblicazione: (2025)
di: Zhao, Bohan, et al.
Pubblicazione: (2025)
COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training
di: Sakip, Akhmed, et al.
Pubblicazione: (2026)
di: Sakip, Akhmed, et al.
Pubblicazione: (2026)
AI Surrogate Model for Distributed Computing Workloads
di: Park, David K., et al.
Pubblicazione: (2024)
di: Park, David K., et al.
Pubblicazione: (2024)
ACE-Sync: An Adaptive Cloud-Edge Synchronization Framework for Communication-Efficient Large-Scale Distributed Model Training
di: Yang, Yi, et al.
Pubblicazione: (2025)
di: Yang, Yi, et al.
Pubblicazione: (2025)
TF-DDRL: A Transformer-enhanced Distributed DRL Technique for Scheduling IoT Applications in Edge and Cloud Computing Environments
di: Wang, Zhiyu, et al.
Pubblicazione: (2024)
di: Wang, Zhiyu, et al.
Pubblicazione: (2024)
Proactive and Reactive Autoscaling Techniques for Edge Computing
di: Gupta, Suhrid, et al.
Pubblicazione: (2025)
di: Gupta, Suhrid, et al.
Pubblicazione: (2025)
A Study on the Performance of Distributed Training of Data-driven CFD Simulations
di: Iserte, Sergio, et al.
Pubblicazione: (2026)
di: Iserte, Sergio, et al.
Pubblicazione: (2026)
Enhancing Memory Efficiency in Large Language Model Training Through Chronos-aware Pipeline Parallelism
di: Lin, Xinyuan, et al.
Pubblicazione: (2025)
di: Lin, Xinyuan, et al.
Pubblicazione: (2025)
Adaptive Configuration Selection for Multi-Model Inference Pipelines in Edge Computing
di: Sheng, Jinhao, et al.
Pubblicazione: (2025)
di: Sheng, Jinhao, et al.
Pubblicazione: (2025)
Inference Acceleration for Large Language Models on CPUs
di: PS, Ditto, et al.
Pubblicazione: (2024)
di: PS, Ditto, et al.
Pubblicazione: (2024)
Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda
di: Xu, Minxian, et al.
Pubblicazione: (2026)
di: Xu, Minxian, et al.
Pubblicazione: (2026)
RapidGNN: Communication Efficient Large-Scale Distributed Training of Graph Neural Networks
di: Niam, Arefin, et al.
Pubblicazione: (2025)
di: Niam, Arefin, et al.
Pubblicazione: (2025)
Collaborative Inference for Large Models with Task Offloading and Early Exiting
di: Xie, Zuan, et al.
Pubblicazione: (2024)
di: Xie, Zuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities
di: Chen, Zhixiong, et al.
Pubblicazione: (2026) -
TokenSim: Enabling Hardware and Software Exploration for Large Language Model Inference Systems
di: Wu, Feiyang, et al.
Pubblicazione: (2025) -
Characterizing Communication Patterns in Distributed Large Language Model Inference
di: Xu, Lang, et al.
Pubblicazione: (2025) -
Efficient Training of Large Language Models on Distributed Infrastructures: A Survey
di: Duan, Jiangfei, et al.
Pubblicazione: (2024) -
Galvatron: Automatic Distributed Training for Large Transformer Models
di: Gumaan, Esmail
Pubblicazione: (2025)