Comparative Study of Large Language Model Architectures on Frontier
Fuente:
arXiv
Salvato in:
| Autori principali: | Yin, Junqi, Bose, Avishek, Cong, Guojing, Lyngaas, Isaac, Anthony, Quentin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FLYING SERVING: On-the-Fly Parallelism Switching for Large Language Model Serving
di: Gao, Shouwei, et al.
Pubblicazione: (2026)
di: Gao, Shouwei, et al.
Pubblicazione: (2026)
Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning
di: Xu, Lang, et al.
Pubblicazione: (2025)
di: Xu, Lang, et al.
Pubblicazione: (2025)
The Case for Co-Designing Model Architectures with Hardware
di: Anthony, Quentin, et al.
Pubblicazione: (2024)
di: Anthony, Quentin, et al.
Pubblicazione: (2024)
Characterizing Communication Patterns in Distributed Large Language Model Inference
di: Xu, Lang, et al.
Pubblicazione: (2025)
di: Xu, Lang, et al.
Pubblicazione: (2025)
Cost-Performance Analysis: A Comparative Study of CPU-Based Serverless and GPU-Based Training Architectures
di: Barrak, Amine, et al.
Pubblicazione: (2025)
di: Barrak, Amine, et al.
Pubblicazione: (2025)
An Explorative Study on Distributed Computing Techniques in Training and Inference of Large Language Models
di: Hakim, Sheikh Azizul, et al.
Pubblicazione: (2025)
di: Hakim, Sheikh Azizul, et al.
Pubblicazione: (2025)
Accelerating Large Language Model Training with Hybrid GPU-based Compression
di: Xu, Lang, et al.
Pubblicazione: (2024)
di: Xu, Lang, et al.
Pubblicazione: (2024)
Big Data Architecture for Large Organizations
di: Ismail, Fathima Nuzla, et al.
Pubblicazione: (2025)
di: Ismail, Fathima Nuzla, et al.
Pubblicazione: (2025)
Paradigm Shift in Infrastructure Inspection Technology: Leveraging High-performance Imaging and Advanced AI Analytics to Inspect Road Infrastructure
di: Wu, Du, et al.
Pubblicazione: (2025)
di: Wu, Du, et al.
Pubblicazione: (2025)
Comparing the Run-time Behavior of Modern PDES Engines on Alternative Hardware Architectures
di: Marotta, Romolo, et al.
Pubblicazione: (2025)
di: Marotta, Romolo, et al.
Pubblicazione: (2025)
Folding Tensor and Sequence Parallelism for Memory-Efficient Transformer Training & Inference
di: Shyam, Vasu, et al.
Pubblicazione: (2026)
di: Shyam, Vasu, et al.
Pubblicazione: (2026)
YAIFS: Yet (not) Another Intelligent Fog Simulator: A Framework for Agent-Driven Computing Continuum Modeling & Simulation
di: Lera, Isaac, et al.
Pubblicazione: (2026)
di: Lera, Isaac, et al.
Pubblicazione: (2026)
SLO-Aware Scheduling for Large Language Model Inferences
di: Huang, Jinqi, et al.
Pubblicazione: (2025)
di: Huang, Jinqi, et al.
Pubblicazione: (2025)
SPIN: Accelerating Large Language Model Inference with Heterogeneous Speculative Models
di: Chen, Fahao, et al.
Pubblicazione: (2025)
di: Chen, Fahao, et al.
Pubblicazione: (2025)
DeepServe: Serverless Large Language Model Serving at Scale
di: Hu, Junhao, et al.
Pubblicazione: (2025)
di: Hu, Junhao, et al.
Pubblicazione: (2025)
Cascadia: An Efficient Cascade Serving System for Large Language Models
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
Split Fine-Tuning for Large Language Models in Wireless Networks
di: Zhang, Songge, et al.
Pubblicazione: (2025)
di: Zhang, Songge, et al.
Pubblicazione: (2025)
Benchmarking the Performance of Large Language Models on the Cerebras Wafer Scale Engine
di: Zhang, Zuoning, et al.
Pubblicazione: (2024)
di: Zhang, Zuoning, et al.
Pubblicazione: (2024)
NanoFlow: Towards Optimal Large Language Model Serving Throughput
di: Zhu, Kan, et al.
Pubblicazione: (2024)
di: Zhu, Kan, et al.
Pubblicazione: (2024)
Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution
di: Wang, Siqi, et al.
Pubblicazione: (2024)
di: Wang, Siqi, et al.
Pubblicazione: (2024)
CrashEventLLM: Predicting System Crashes with Large Language Models
di: Mudgal, Priyanka, et al.
Pubblicazione: (2024)
di: Mudgal, Priyanka, et al.
Pubblicazione: (2024)
A Review on Edge Large Language Models: Design, Execution, and Applications
di: Zheng, Yue, et al.
Pubblicazione: (2024)
di: Zheng, Yue, et al.
Pubblicazione: (2024)
Efficient Training of Large Language Models on Distributed Infrastructures: A Survey
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
Developing an Interactive OpenMP Programming Book with Large Language Models
di: Yi, Xinyao, et al.
Pubblicazione: (2024)
di: Yi, Xinyao, et al.
Pubblicazione: (2024)
Memory Offloading for Large Language Model Inference with Latency SLO Guarantees
di: Ma, Chenxiang, et al.
Pubblicazione: (2025)
di: Ma, Chenxiang, et al.
Pubblicazione: (2025)
Pier: Efficient Large Language Model pretraining with Relaxed Global Communication
di: Fan, Shuyuan, et al.
Pubblicazione: (2025)
di: Fan, Shuyuan, et al.
Pubblicazione: (2025)
Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities
di: Chen, Zhixiong, et al.
Pubblicazione: (2026)
di: Chen, Zhixiong, et al.
Pubblicazione: (2026)
Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference
di: He, Zifan, et al.
Pubblicazione: (2026)
di: He, Zifan, et al.
Pubblicazione: (2026)
DGNNFlow: A Streaming Dataflow Architecture for Real-Time Edge-based Dynamic GNN Inference in HL-LHC Trigger Systems
di: Maharaj, Davendra, et al.
Pubblicazione: (2026)
di: Maharaj, Davendra, et al.
Pubblicazione: (2026)
Exploring the Frontiers of Energy Efficiency using Power Management at System Scale
di: Karimi, Ahmad Maroof, et al.
Pubblicazione: (2024)
di: Karimi, Ahmad Maroof, et al.
Pubblicazione: (2024)
DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models
di: Zhang, Zili, et al.
Pubblicazione: (2024)
di: Zhang, Zili, et al.
Pubblicazione: (2024)
BlockLLM: Multi-tenant Finer-grained Serving for Large Language Models
di: Hu, Bodun, et al.
Pubblicazione: (2024)
di: Hu, Bodun, et al.
Pubblicazione: (2024)
HexiScale: Facilitating Large Language Model Training over Heterogeneous Hardware
di: Yan, Ran, et al.
Pubblicazione: (2024)
di: Yan, Ran, et al.
Pubblicazione: (2024)
HydraInfer: Hybrid Disaggregated Scheduling for Multimodal Large Language Model Serving
di: Dong, Xianzhe, et al.
Pubblicazione: (2025)
di: Dong, Xianzhe, et al.
Pubblicazione: (2025)
HexGen: Generative Inference of Large Language Model over Heterogeneous Environment
di: Jiang, Youhe, et al.
Pubblicazione: (2023)
di: Jiang, Youhe, et al.
Pubblicazione: (2023)
λScale: Enabling Fast Scaling for Serverless Large Language Model Inference
di: Yu, Minchen, et al.
Pubblicazione: (2025)
di: Yu, Minchen, et al.
Pubblicazione: (2025)
An Engineering Journey Training Large Language Models at Scale on Alps: The Apertus Experience
di: Coles, Jonathan, et al.
Pubblicazione: (2026)
di: Coles, Jonathan, et al.
Pubblicazione: (2026)
ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production
di: Xiang, Yuxing, et al.
Pubblicazione: (2025)
di: Xiang, Yuxing, et al.
Pubblicazione: (2025)
Distributed Resource Selection for Self-Organising Cloud-Edge Systems
di: Renau, Quentin, et al.
Pubblicazione: (2025)
di: Renau, Quentin, et al.
Pubblicazione: (2025)
A Study of Performance Programming of CPU, GPU accelerated Computers and SIMD Architecture
di: Yi, Xinyao
Pubblicazione: (2024)
di: Yi, Xinyao
Pubblicazione: (2024)
Documenti analoghi
-
FLYING SERVING: On-the-Fly Parallelism Switching for Large Language Model Serving
di: Gao, Shouwei, et al.
Pubblicazione: (2026) -
Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning
di: Xu, Lang, et al.
Pubblicazione: (2025) -
The Case for Co-Designing Model Architectures with Hardware
di: Anthony, Quentin, et al.
Pubblicazione: (2024) -
Characterizing Communication Patterns in Distributed Large Language Model Inference
di: Xu, Lang, et al.
Pubblicazione: (2025) -
Cost-Performance Analysis: A Comparative Study of CPU-Based Serverless and GPU-Based Training Architectures
di: Barrak, Amine, et al.
Pubblicazione: (2025)