SplitLLM: Collaborative Inference of LLMs for Model Placement and Throughput Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Mudvari, Akrit, Jiang, Yuang, Tassiulas, Leandros |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CLAD: A Clustered Label-Agnostic Federated Learning Framework for Joint Anomaly Detection and Attack Classification
by: Ofeidis, Iason, et al.
Published: (2026)
by: Ofeidis, Iason, et al.
Published: (2026)
Adaptive Heterogeneous Client Sampling for Federated Learning over Wireless Networks
by: Luo, Bing, et al.
Published: (2024)
by: Luo, Bing, et al.
Published: (2024)
Workflow Optimization for Parallel Split Learning
by: Tirana, Joana, et al.
Published: (2024)
by: Tirana, Joana, et al.
Published: (2024)
Hierarchical Online-Scheduling for Energy-Efficient Split Inference with Progressive Transmission
by: Tang, Zengzipeng, et al.
Published: (2026)
by: Tang, Zengzipeng, et al.
Published: (2026)
Adaptive Compression-Aware Split Learning and Inference for Enhanced Network Efficiency
by: Mudvari, Akrit, et al.
Published: (2023)
by: Mudvari, Akrit, et al.
Published: (2023)
Joint Partitioning and Placement of Foundation Models for Real-Time Edge AI
by: Djuhera, Aladin, et al.
Published: (2025)
by: Djuhera, Aladin, et al.
Published: (2025)
ForestColl: Throughput-Optimal Collective Communications on Heterogeneous Network Fabrics
by: Zhao, Liangyu, et al.
Published: (2024)
by: Zhao, Liangyu, et al.
Published: (2024)
Federated Split Learning with Model Pruning and Gradient Quantization in Wireless Networks
by: Zhang, Junhe, et al.
Published: (2024)
by: Zhang, Junhe, et al.
Published: (2024)
Throughput-Optimized Networks at Scale
by: Green, Conor James, et al.
Published: (2026)
by: Green, Conor James, et al.
Published: (2026)
Split Learning in 6G Edge Networks
by: Lin, Zheng, et al.
Published: (2023)
by: Lin, Zheng, et al.
Published: (2023)
PerLLM: Personalized Inference Scheduling with Edge-Cloud Collaboration for Diverse LLM Services
by: Yang, Zheming, et al.
Published: (2024)
by: Yang, Zheming, et al.
Published: (2024)
Service Placement in Small Cell Networks Using Distributed Best Arm Identification in Linear Bandits
by: Yahya, Mariam, et al.
Published: (2025)
by: Yahya, Mariam, et al.
Published: (2025)
Joint Optimization of Training and Inference in Federated Edge Learning via Constrained Multi-Objective Deep Reinforcement Learning
by: Li, Zhen, et al.
Published: (2026)
by: Li, Zhen, et al.
Published: (2026)
COMSPLIT: A Communication-Aware Split Learning Design for Heterogeneous IoT Platforms
by: Ninkovic, Vukan, et al.
Published: (2024)
by: Ninkovic, Vukan, et al.
Published: (2024)
MergeSFL: Split Federated Learning with Feature Merging and Batch Size Regulation
by: Liao, Yunming, et al.
Published: (2023)
by: Liao, Yunming, et al.
Published: (2023)
SFL-LEO: Asynchronous Split-Federated Learning Design for LEO Satellite-Ground Network Framework
by: Wu, Jiasheng, et al.
Published: (2025)
by: Wu, Jiasheng, et al.
Published: (2025)
InfiniteHBD: Building Datacenter-Scale High-Bandwidth Domain for LLM with Optical Circuit Switching Transceivers
by: Shou, Chenchen, et al.
Published: (2025)
by: Shou, Chenchen, et al.
Published: (2025)
SlimCaching: Edge Caching of Mixture-of-Experts for Distributed Inference
by: Chen, Qian, et al.
Published: (2025)
by: Chen, Qian, et al.
Published: (2025)
Topology-aware Microservice Architecture in Edge Networks: Deployment Optimization and Implementation
by: Chen, Yuang, et al.
Published: (2025)
by: Chen, Yuang, et al.
Published: (2025)
Optimizing Server Placement for Vertical Federated Learning in Dynamic Edge/Fog Networks
by: Wang, Su, et al.
Published: (2026)
by: Wang, Su, et al.
Published: (2026)
Reliable and Resilient Collective Communication Library for LLM Training and Serving
by: Wang, Wei, et al.
Published: (2025)
by: Wang, Wei, et al.
Published: (2025)
Satellite Federated Fine-Tuning for Foundation Models in Space Computing Power Networks
by: Zhu, Yan, et al.
Published: (2025)
by: Zhu, Yan, et al.
Published: (2025)
Optimizing Edge Offloading Decisions for Object Detection
by: Qiu, Jiaming, et al.
Published: (2024)
by: Qiu, Jiaming, et al.
Published: (2024)
Network Digital Untwinning: Towards Backward Optimization of Digital Twins
by: Zhang, Zifan, et al.
Published: (2026)
by: Zhang, Zifan, et al.
Published: (2026)
Hierarchical Split Federated Learning: Convergence Analysis and System Optimization
by: Lin, Zheng, et al.
Published: (2024)
by: Lin, Zheng, et al.
Published: (2024)
FedRDMA: Communication-Efficient Cross-Silo Federated LLM via Chunked RDMA Transmission
by: Zhang, Zeling, et al.
Published: (2024)
by: Zhang, Zeling, et al.
Published: (2024)
Device Sampling and Resource Optimization for Federated Learning in Cooperative Edge Networks
by: Wang, Su, et al.
Published: (2023)
by: Wang, Su, et al.
Published: (2023)
Graph Theory Meets Federated Learning over Satellite Constellations: Spanning Aggregations, Network Formation, and Performance Optimization
by: Nadimi, Fardis, et al.
Published: (2025)
by: Nadimi, Fardis, et al.
Published: (2025)
Performance Analysis of Decentralized Federated Learning Deployments
by: Jiang, Chengyan, et al.
Published: (2025)
by: Jiang, Chengyan, et al.
Published: (2025)
Galaxy: A Resource-Efficient Collaborative Edge AI System for In-situ Transformer Inference
by: Ye, Shengyuan, et al.
Published: (2024)
by: Ye, Shengyuan, et al.
Published: (2024)
Don't Let a Few Network Failures Slow the Entire AllReduce
by: Chen, Peiqing, et al.
Published: (2026)
by: Chen, Peiqing, et al.
Published: (2026)
EMA: Efficient Model Adaptation for Learning-based Systems
by: Yu, Daiyang, et al.
Published: (2026)
by: Yu, Daiyang, et al.
Published: (2026)
Temporal-Aware GPU Resource Allocation for Distributed LLM Inference via Reinforcement Learning
by: Du, Chengze, et al.
Published: (2025)
by: Du, Chengze, et al.
Published: (2025)
Efficient Fog Node Placement using Nature-Inspired Metaheuristic for IoT Applications
by: Naouri, Abdenacer, et al.
Published: (2023)
by: Naouri, Abdenacer, et al.
Published: (2023)
LEO-Split: A Semi-Supervised Split Learning Framework over LEO Satellite Networks
by: Lin, Zheng, et al.
Published: (2025)
by: Lin, Zheng, et al.
Published: (2025)
$Λ$-Split: A Privacy-Preserving Split Computing Framework for Cloud-Powered Generative AI
by: Ohta, Shoki, et al.
Published: (2023)
by: Ohta, Shoki, et al.
Published: (2023)
LOAM: Low-latency Communication, Caching, and Computation Placement in Data-Intensive Computing Networks
by: Zhang, Jinkun, et al.
Published: (2024)
by: Zhang, Jinkun, et al.
Published: (2024)
A Task Decomposition and Planning Framework for Efficient LLM Inference in AI-Enabled WiFi-Offload Networks
by: Han, Mingqi, et al.
Published: (2026)
by: Han, Mingqi, et al.
Published: (2026)
GELATO: Generative Entropy- and Lyapunov-based Adaptive Token Offloading for Device-Edge Speculative LLM Inference
by: Tang, Zengzipeng, et al.
Published: (2026)
by: Tang, Zengzipeng, et al.
Published: (2026)
Jupiter: Fast and Resource-Efficient Collaborative Inference of Generative LLMs on Edge Devices
by: Ye, Shengyuan, et al.
Published: (2025)
by: Ye, Shengyuan, et al.
Published: (2025)
Similar Items
-
CLAD: A Clustered Label-Agnostic Federated Learning Framework for Joint Anomaly Detection and Attack Classification
by: Ofeidis, Iason, et al.
Published: (2026) -
Adaptive Heterogeneous Client Sampling for Federated Learning over Wireless Networks
by: Luo, Bing, et al.
Published: (2024) -
Workflow Optimization for Parallel Split Learning
by: Tirana, Joana, et al.
Published: (2024) -
Hierarchical Online-Scheduling for Energy-Efficient Split Inference with Progressive Transmission
by: Tang, Zengzipeng, et al.
Published: (2026) -
Adaptive Compression-Aware Split Learning and Inference for Enhanced Network Efficiency
by: Mudvari, Akrit, et al.
Published: (2023)