DiSCo: Device-Server Collaborative LLM-Based Text Streaming Services
Fuente:
arXiv
Saved in:
| Main Authors: | Sun, Ting, Wang, Penghan, Lai, Fan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HyGen: Efficient LLM Serving via Elastic Online-Offline Request Co-location
by: Sun, Ting, et al.
Published: (2025)
by: Sun, Ting, et al.
Published: (2025)
Andes: Defining and Enhancing Quality-of-Experience in LLM-Based Text Streaming Services
by: Liu, Jiachen, et al.
Published: (2024)
by: Liu, Jiachen, et al.
Published: (2024)
Venn: Resource Management for Collaborative Learning Jobs
by: Liu, Jiachen, et al.
Published: (2023)
by: Liu, Jiachen, et al.
Published: (2023)
PackInfer: Compute- and I/O-Efficient Attention for Batched LLM Inference
by: Ning, Rui, et al.
Published: (2026)
by: Ning, Rui, et al.
Published: (2026)
Adaptive Stream Processing on Edge Devices through Active Inference
by: Sedlak, Boris, et al.
Published: (2024)
by: Sedlak, Boris, et al.
Published: (2024)
CycleSL: Server-Client Cyclical Update Driven Scalable Split Learning
by: Wang, Mengdi, et al.
Published: (2025)
by: Wang, Mengdi, et al.
Published: (2025)
High Order Collaboration-Oriented Federated Graph Neural Network for Accurate QoS Prediction
by: Chen, Zehuan, et al.
Published: (2025)
by: Chen, Zehuan, et al.
Published: (2025)
CoFormer: Collaborating with Heterogeneous Edge Devices for Scalable Transformer Inference
by: Xu, Guanyu, et al.
Published: (2025)
by: Xu, Guanyu, et al.
Published: (2025)
PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR
by: Zhang, Yiqi, et al.
Published: (2026)
by: Zhang, Yiqi, et al.
Published: (2026)
Understanding Server-Assisted Federated Learning in the Presence of Incomplete Client Participation
by: Yang, Haibo, et al.
Published: (2024)
by: Yang, Haibo, et al.
Published: (2024)
Enhancing Model Context Protocol (MCP) with Context-Aware Server Collaboration
by: Jayanti, Meenakshi Amulya, et al.
Published: (2026)
by: Jayanti, Meenakshi Amulya, et al.
Published: (2026)
ProDiGy: Proximity- and Dissimilarity-Based Byzantine-Robust Federated Learning
by: Ergisi, Sena, et al.
Published: (2025)
by: Ergisi, Sena, et al.
Published: (2025)
Collaborative Speculative Inference for Efficient LLM Inference Serving
by: Gao, Luyao, et al.
Published: (2025)
by: Gao, Luyao, et al.
Published: (2025)
Detection of Global Anomalies on Distributed IoT Edges with Device-to-Device Communication
by: Ochiai, Hideya, et al.
Published: (2024)
by: Ochiai, Hideya, et al.
Published: (2024)
Communication-Efficient Federated Learning through Adaptive Weight Clustering and Server-Side Distillation
by: Tsouvalas, Vasileios, et al.
Published: (2024)
by: Tsouvalas, Vasileios, et al.
Published: (2024)
Multi-Dimensional Autoscaling of Stream Processing Services on Edge Devices
by: Sedlak, Boris, et al.
Published: (2025)
by: Sedlak, Boris, et al.
Published: (2025)
Challenging GPU Dominance: When CPUs Outperform for On-Device LLM Inference
by: Zhang, Haolin, et al.
Published: (2025)
by: Zhang, Haolin, et al.
Published: (2025)
Asynch-SGBDT: Asynchronous Parallel Stochastic Gradient Boosting Decision Tree based on Parameters Server
by: Daning, Cheng, et al.
Published: (2018)
by: Daning, Cheng, et al.
Published: (2018)
PAAC: Privacy-Aware Agentic Device-Cloud Collaboration
by: Yuan, Liangqi, et al.
Published: (2026)
by: Yuan, Liangqi, et al.
Published: (2026)
DG-CoLearn: An Efficient Collaborative Learning Framework for Dynamic Graphs
by: Au, Ashley Hoi-Ting, et al.
Published: (2026)
by: Au, Ashley Hoi-Ting, et al.
Published: (2026)
Collaborative Learning of On-Device Small Model and Cloud-Based Large Model: Advances and Future Directions
by: Niu, Chaoyue, et al.
Published: (2025)
by: Niu, Chaoyue, et al.
Published: (2025)
TetriServe: Efficient DiT Serving for Heterogeneous Image Generation
by: Lu, Runyu, et al.
Published: (2025)
by: Lu, Runyu, et al.
Published: (2025)
StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation
by: Zhong, Yinmin, et al.
Published: (2025)
by: Zhong, Yinmin, et al.
Published: (2025)
CE-CoLLM: Efficient and Adaptive Large Language Models Through Cloud-Edge Collaboration
by: Jin, Hongpeng, et al.
Published: (2024)
by: Jin, Hongpeng, et al.
Published: (2024)
DiReDi: Distillation and Reverse Distillation for AIoT Applications
by: Sun, Chen, et al.
Published: (2024)
by: Sun, Chen, et al.
Published: (2024)
Synera: Synergistic LLM Serving across Device and Cloud at Scale
by: Wang, Genglin, et al.
Published: (2025)
by: Wang, Genglin, et al.
Published: (2025)
How to Collaborate: Towards Maximizing the Generalization Performance in Cross-Silo Federated Learning
by: Sun, Yuchang, et al.
Published: (2024)
by: Sun, Yuchang, et al.
Published: (2024)
EDGE-LLM: Enabling Efficient Large Language Model Adaptation on Edge Devices via Layerwise Unified Compression and Adaptive Layer Tuning and Voting
by: Yu, Zhongzhi, et al.
Published: (2024)
by: Yu, Zhongzhi, et al.
Published: (2024)
Accelerating AIGC Services with Latent Action Diffusion Scheduling in Edge Networks
by: Xu, Changfu, et al.
Published: (2024)
by: Xu, Changfu, et al.
Published: (2024)
A Survey on Collaborative DNN Inference for Edge Intelligence
by: Ren, Weiqing, et al.
Published: (2022)
by: Ren, Weiqing, et al.
Published: (2022)
The Streaming Batch Model for Efficient and Fault-Tolerant Heterogeneous Execution
by: Luan, Frank Sifei, et al.
Published: (2025)
by: Luan, Frank Sifei, et al.
Published: (2025)
Agglomerative Federated Learning: Empowering Larger Model Training via End-Edge-Cloud Collaboration
by: Wu, Zhiyuan, et al.
Published: (2023)
by: Wu, Zhiyuan, et al.
Published: (2023)
Timeliness-Oriented Scheduling and Resource Allocation in Multi-Region Collaborative Perception
by: Zhu, Mengmeng, et al.
Published: (2026)
by: Zhu, Mengmeng, et al.
Published: (2026)
Metadata-Guided Adaptable Frequency Scaling across Heterogeneous Applications and Devices
by: Yan, Jinqi, et al.
Published: (2025)
by: Yan, Jinqi, et al.
Published: (2025)
Tackling Intertwined Data and Device Heterogeneities in Federated Learning with Unlimited Staleness
by: Wang, Haoming, et al.
Published: (2023)
by: Wang, Haoming, et al.
Published: (2023)
MultiTASC++: A Continuously Adaptive Scheduler for Edge-Based Multi-Device Cascade Inference
by: Nikolaidis, Sokratis, et al.
Published: (2024)
by: Nikolaidis, Sokratis, et al.
Published: (2024)
OpenDiLoCo: An Open-Source Framework for Globally Distributed Low-Communication Training
by: Jaghouar, Sami, et al.
Published: (2024)
by: Jaghouar, Sami, et al.
Published: (2024)
Harli: SLO-Aware Co-location of LLM Inference and PEFT-based Finetuning on Model-as-a-Service Platforms
by: Xu, Ao, et al.
Published: (2025)
by: Xu, Ao, et al.
Published: (2025)
Ecomap: Sustainability-Driven Optimization of Multi-Tenant DNN Execution on Edge Servers
by: Paramanayakam, Varatheepan, et al.
Published: (2025)
by: Paramanayakam, Varatheepan, et al.
Published: (2025)
Privacy-Enhanced Training-as-a-Service for On-Device Intelligence: Concept, Architectural Scheme, and Open Problems
by: Wu, Zhiyuan, et al.
Published: (2024)
by: Wu, Zhiyuan, et al.
Published: (2024)
Similar Items
-
HyGen: Efficient LLM Serving via Elastic Online-Offline Request Co-location
by: Sun, Ting, et al.
Published: (2025) -
Andes: Defining and Enhancing Quality-of-Experience in LLM-Based Text Streaming Services
by: Liu, Jiachen, et al.
Published: (2024) -
Venn: Resource Management for Collaborative Learning Jobs
by: Liu, Jiachen, et al.
Published: (2023) -
PackInfer: Compute- and I/O-Efficient Attention for Batched LLM Inference
by: Ning, Rui, et al.
Published: (2026) -
Adaptive Stream Processing on Edge Devices through Active Inference
by: Sedlak, Boris, et al.
Published: (2024)