Saved in:
| Main Authors: | Liu, Huiying, Zhang, Zekun, Li, Honghao, Wu, Qilin, Zhang, Yiwen |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2408.02223 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
High Order Collaboration-Oriented Federated Graph Neural Network for Accurate QoS Prediction
by: Chen, Zehuan, et al.
Published: (2025)
by: Chen, Zehuan, et al.
Published: (2025)
Feature Noise Resilient for QoS Prediction with Probabilistic Deep Supervision
by: Wang, Ziliang, et al.
Published: (2023)
by: Wang, Ziliang, et al.
Published: (2023)
QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration
by: Imani, HamidReza, et al.
Published: (2025)
by: Imani, HamidReza, et al.
Published: (2025)
Mercury: QoS-Aware Tiered Memory System
by: Lu, Jiaheng, et al.
Published: (2024)
by: Lu, Jiaheng, et al.
Published: (2024)
QEdgeProxy: QoS-Aware Load Balancing for IoT Services in the Computing Continuum
by: Čilić, Ivan, et al.
Published: (2024)
by: Čilić, Ivan, et al.
Published: (2024)
SiDA-MoE: Sparsity-Inspired Data-Aware Serving for Efficient and Scalable Large Mixture-of-Experts Models
by: Du, Zhixu, et al.
Published: (2023)
by: Du, Zhixu, et al.
Published: (2023)
Fast Distributed Inference Serving for Large Language Models
by: Wu, Bingyang, et al.
Published: (2023)
by: Wu, Bingyang, et al.
Published: (2023)
Efficient Heterogeneous Large Language Model Decoding with Model-Attention Disaggregation
by: Chen, Shaoyuan, et al.
Published: (2024)
by: Chen, Shaoyuan, et al.
Published: (2024)
DuoServe-MoE: Dual-Phase Expert Prefetch and Caching for LLM Inference QoS Assurance
by: Zhang, Yuning, et al.
Published: (2025)
by: Zhang, Yuning, et al.
Published: (2025)
NestPipe: Large-Scale Recommendation Training on 1,500+ Accelerators via Nested Pipelining
by: Jiang, Zhida, et al.
Published: (2026)
by: Jiang, Zhida, et al.
Published: (2026)
Two-dimensional Sparse Parallelism for Large Scale Deep Learning Recommendation Model Training
by: Zhang, Xin, et al.
Published: (2025)
by: Zhang, Xin, et al.
Published: (2025)
BOOST: BOttleneck-Optimized Scalable Training Framework for Low-Rank Large Language Models
by: Wang, Zhengyang, et al.
Published: (2025)
by: Wang, Zhengyang, et al.
Published: (2025)
Characterization of Large Language Model Development in the Datacenter
by: Hu, Qinghao, et al.
Published: (2024)
by: Hu, Qinghao, et al.
Published: (2024)
Venn: Resource Management for Collaborative Learning Jobs
by: Liu, Jiachen, et al.
Published: (2023)
by: Liu, Jiachen, et al.
Published: (2023)
QoE-oriented Dependent Task Scheduling under Multi-dimensional QoS Constraints over Distributed Networks
by: Fan, Xuwei, et al.
Published: (2023)
by: Fan, Xuwei, et al.
Published: (2023)
QONNECT: A QoS-Aware Orchestration System for Distributed Kubernetes Clusters
by: Aslan, Haci Ismail, et al.
Published: (2025)
by: Aslan, Haci Ismail, et al.
Published: (2025)
A Survey on Federated Fine-tuning of Large Language Models
by: Wu, Yebo, et al.
Published: (2025)
by: Wu, Yebo, et al.
Published: (2025)
FlexSP: Accelerating Large Language Model Training via Flexible Sequence Parallelism
by: Wang, Yujie, et al.
Published: (2024)
by: Wang, Yujie, et al.
Published: (2024)
TurboGR: An Accelerated Training System for Large-Scale Generative Recommendation
by: Chai, Huichao, et al.
Published: (2026)
by: Chai, Huichao, et al.
Published: (2026)
Computing in the Era of Large Generative Models: From Cloud-Native to AI-Native
by: Lu, Yao, et al.
Published: (2024)
by: Lu, Yao, et al.
Published: (2024)
Energy-Efficient Split Learning for Fine-Tuning Large Language Models in Edge Networks
by: Li, Zuguang, et al.
Published: (2024)
by: Li, Zuguang, et al.
Published: (2024)
LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism
by: Wu, Bingyang, et al.
Published: (2024)
by: Wu, Bingyang, et al.
Published: (2024)
GAS: Generative Activation-Aided Asynchronous Split Federated Learning
by: Yang, Jiarong, et al.
Published: (2024)
by: Yang, Jiarong, et al.
Published: (2024)
Towards Sustainable Large Language Model Serving
by: Nguyen, Sophia, et al.
Published: (2024)
by: Nguyen, Sophia, et al.
Published: (2024)
A Holistic Framework for Automated Configuration Recommendation for Cloud Service Monitoring
by: Bastos, Anson, et al.
Published: (2026)
by: Bastos, Anson, et al.
Published: (2026)
Stateful Large Language Model Serving with Pensieve
by: Yu, Lingfan, et al.
Published: (2023)
by: Yu, Lingfan, et al.
Published: (2023)
Semantic-Aware Scheduling for GPU Clusters with Large Language Models
by: Wang, Zerui, et al.
Published: (2025)
by: Wang, Zerui, et al.
Published: (2025)
Heterogeneous Parallelism for Multimodal Large Language Model Training
by: Karnati, Yashaswi, et al.
Published: (2026)
by: Karnati, Yashaswi, et al.
Published: (2026)
SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models
by: Wu, Hang, et al.
Published: (2025)
by: Wu, Hang, et al.
Published: (2025)
MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs
by: Jiang, Ziheng, et al.
Published: (2024)
by: Jiang, Ziheng, et al.
Published: (2024)
Minder: Faulty Machine Detection for Large-scale Distributed Model Training
by: Deng, Yangtao, et al.
Published: (2024)
by: Deng, Yangtao, et al.
Published: (2024)
CG-FedLLM: How to Compress Gradients in Federated Fune-tuning for Large Language Models
by: Wu, Huiwen, et al.
Published: (2024)
by: Wu, Huiwen, et al.
Published: (2024)
CE-CoLLM: Efficient and Adaptive Large Language Models Through Cloud-Edge Collaboration
by: Jin, Hongpeng, et al.
Published: (2024)
by: Jin, Hongpeng, et al.
Published: (2024)
DiffKV: Differentiated Memory Management for Large Language Models with Parallel KV Compaction
by: Zhang, Yanqi, et al.
Published: (2024)
by: Zhang, Yanqi, et al.
Published: (2024)
EARL: Efficient Agentic Reinforcement Learning Systems for Large Language Models
by: Tan, Zheyue, et al.
Published: (2025)
by: Tan, Zheyue, et al.
Published: (2025)
QoS-aware Scheduling of Periodic Real-time Task Graphs on Heterogeneous Pre-occupied MECs
by: Shankar, Ashutosh, et al.
Published: (2025)
by: Shankar, Ashutosh, et al.
Published: (2025)
BGTplanner: Maximizing Training Accuracy for Differentially Private Federated Recommenders via Strategic Privacy Budget Allocation
by: Zhang, Xianzhi, et al.
Published: (2024)
by: Zhang, Xianzhi, et al.
Published: (2024)
Mélange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity
by: Griggs, Tyler, et al.
Published: (2024)
by: Griggs, Tyler, et al.
Published: (2024)
Optimizing RLHF Training for Large Language Models with Stage Fusion
by: Zhong, Yinmin, et al.
Published: (2024)
by: Zhong, Yinmin, et al.
Published: (2024)
Towards Resiliency in Large Language Model Serving with KevlarFlow
by: Qian, Shangshu, et al.
Published: (2026)
by: Qian, Shangshu, et al.
Published: (2026)
Similar Items
-
High Order Collaboration-Oriented Federated Graph Neural Network for Accurate QoS Prediction
by: Chen, Zehuan, et al.
Published: (2025) -
Feature Noise Resilient for QoS Prediction with Probabilistic Deep Supervision
by: Wang, Ziliang, et al.
Published: (2023) -
QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration
by: Imani, HamidReza, et al.
Published: (2025) -
Mercury: QoS-Aware Tiered Memory System
by: Lu, Jiaheng, et al.
Published: (2024) -
QEdgeProxy: QoS-Aware Load Balancing for IoT Services in the Computing Continuum
by: Čilić, Ivan, et al.
Published: (2024)