Andes: Defining and Enhancing Quality-of-Experience in LLM-Based Text Streaming Services
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Jiachen, Chung, Jae-Won, Wu, Zhiyu, Lai, Fan, Lee, Myungjin, Chowdhury, Mosharaf |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Kareus: Joint Reduction of Dynamic and Static Energy in Large Model Training
di: Wu, Ruofan, et al.
Pubblicazione: (2026)
di: Wu, Ruofan, et al.
Pubblicazione: (2026)
Cornserve: A Distributed Serving System for Any-to-Any Multimodal Models
di: Chung, Jae-Won, et al.
Pubblicazione: (2026)
di: Chung, Jae-Won, et al.
Pubblicazione: (2026)
Where Do the Joules Go? Diagnosing Inference Energy Consumption
di: Chung, Jae-Won, et al.
Pubblicazione: (2026)
di: Chung, Jae-Won, et al.
Pubblicazione: (2026)
Toward Cross-Layer Energy Optimizations in AI Systems
di: Chung, Jae-Won, et al.
Pubblicazione: (2024)
di: Chung, Jae-Won, et al.
Pubblicazione: (2024)
Cornfigurator: Automated Planning for Any-to-Any Multimodal Model Serving
di: Ma, Jeff J., et al.
Pubblicazione: (2025)
di: Ma, Jeff J., et al.
Pubblicazione: (2025)
Venn: Resource Management for Collaborative Learning Jobs
di: Liu, Jiachen, et al.
Pubblicazione: (2023)
di: Liu, Jiachen, et al.
Pubblicazione: (2023)
FedTrans: Efficient Federated Learning via Multi-Model Transformation
di: Zhu, Yuxuan, et al.
Pubblicazione: (2024)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2024)
Addressing Variable Heterogeneity in Distributed Multimodal Training with Entrain
di: Jang, Insu, et al.
Pubblicazione: (2026)
di: Jang, Insu, et al.
Pubblicazione: (2026)
DiSCo: Device-Server Collaborative LLM-Based Text Streaming Services
di: Sun, Ting, et al.
Pubblicazione: (2025)
di: Sun, Ting, et al.
Pubblicazione: (2025)
OpenG2G: A Simulation Platform for AI Datacenter-Grid Runtime Coordination
di: Chung, Jae-Won, et al.
Pubblicazione: (2026)
di: Chung, Jae-Won, et al.
Pubblicazione: (2026)
Reducing Energy Bloat in Large Model Training
di: Chung, Jae-Won, et al.
Pubblicazione: (2023)
di: Chung, Jae-Won, et al.
Pubblicazione: (2023)
Software-Defined Agentic Serving
di: Agarwal, Saurabh, et al.
Pubblicazione: (2026)
di: Agarwal, Saurabh, et al.
Pubblicazione: (2026)
CacheFlow: Efficient LLM Serving with 3D-Parallel KV Cache Restoration
di: Nian, Sean, et al.
Pubblicazione: (2026)
di: Nian, Sean, et al.
Pubblicazione: (2026)
JITServe: SLO-aware LLM Serving with Imprecise Request Information
di: Zhang, Wei, et al.
Pubblicazione: (2025)
di: Zhang, Wei, et al.
Pubblicazione: (2025)
Efficient Distributed MLLM Training with Cornstarch
di: Jang, Insu, et al.
Pubblicazione: (2025)
di: Jang, Insu, et al.
Pubblicazione: (2025)
KAIROS: Stateful, Context-Aware Power-Efficient Agentic Inference Serving
di: Yuan, Yichao, et al.
Pubblicazione: (2026)
di: Yuan, Yichao, et al.
Pubblicazione: (2026)
Enabling Elastic Model Serving with MultiWorld
di: Lee, Myungjin, et al.
Pubblicazione: (2024)
di: Lee, Myungjin, et al.
Pubblicazione: (2024)
Mercury: QoS-Aware Tiered Memory System
di: Lu, Jiaheng, et al.
Pubblicazione: (2024)
di: Lu, Jiaheng, et al.
Pubblicazione: (2024)
BlockLLM: Multi-tenant Finer-grained Serving for Large Language Models
di: Hu, Bodun, et al.
Pubblicazione: (2024)
di: Hu, Bodun, et al.
Pubblicazione: (2024)
Making MoE-based LLM Inference Resilient with Tarragon
di: Zhang, Songyu, et al.
Pubblicazione: (2026)
di: Zhang, Songyu, et al.
Pubblicazione: (2026)
LIFL: A Lightweight, Event-driven Serverless Platform for Federated Learning
di: Qi, Shixiong, et al.
Pubblicazione: (2024)
di: Qi, Shixiong, et al.
Pubblicazione: (2024)
A Risk-Aware UAV-Edge Service Framework for Wildfire Monitoring and Emergency Response
di: Huang, Yulun, et al.
Pubblicazione: (2026)
di: Huang, Yulun, et al.
Pubblicazione: (2026)
Dora: QoE-Aware Hybrid Parallelism for Distributed Edge AI
di: Jin, Jianli, et al.
Pubblicazione: (2025)
di: Jin, Jianli, et al.
Pubblicazione: (2025)
Performance and Security Aware Distributed Service Placement in Fog Computing
di: Goudarzi, Mohammad, et al.
Pubblicazione: (2026)
di: Goudarzi, Mohammad, et al.
Pubblicazione: (2026)
Identifying Quality Mersenne Twister Streams For Parallel Stochastic Simulations
di: Antunes, Benjamin, et al.
Pubblicazione: (2024)
di: Antunes, Benjamin, et al.
Pubblicazione: (2024)
Prediction-Assisted Online Distributed Deep Learning Workload Scheduling in GPU Clusters
di: Luo, Ziyue, et al.
Pubblicazione: (2025)
di: Luo, Ziyue, et al.
Pubblicazione: (2025)
An Efficient and Adaptive Watermark Detection System with Tile-based Error Correction
di: Zhong, Xinrui, et al.
Pubblicazione: (2025)
di: Zhong, Xinrui, et al.
Pubblicazione: (2025)
TetriServe: Efficient DiT Serving for Heterogeneous Image Generation
di: Lu, Runyu, et al.
Pubblicazione: (2025)
di: Lu, Runyu, et al.
Pubblicazione: (2025)
Seer: Proactive Revenue-Aware Scheduling for Live Streaming Services in Crowdsourced Cloud-Edge Platforms
di: Huang, Shaoyuan, et al.
Pubblicazione: (2024)
di: Huang, Shaoyuan, et al.
Pubblicazione: (2024)
BLOCKS: Blockchain-supported Cross-Silo Knowledge Sharing for Efficient LLM Services
di: Zhou, Zhaojiacheng, et al.
Pubblicazione: (2025)
di: Zhou, Zhaojiacheng, et al.
Pubblicazione: (2025)
DéjàVu: KV-cache Streaming for Fast, Fault-tolerant Generative LLM Serving
di: Strati, Foteini, et al.
Pubblicazione: (2024)
di: Strati, Foteini, et al.
Pubblicazione: (2024)
Amoeba: Runtime Tensor Parallel Transformation for LLM Inference Services
di: Chen, Haoyu, et al.
Pubblicazione: (2025)
di: Chen, Haoyu, et al.
Pubblicazione: (2025)
FlowMesh: A Service Fabric for Composable LLM Workflows
di: Shen, Junyi, et al.
Pubblicazione: (2025)
di: Shen, Junyi, et al.
Pubblicazione: (2025)
Parallax: Efficient LLM Inference Service over Decentralized Environment
di: Tong, Chris, et al.
Pubblicazione: (2025)
di: Tong, Chris, et al.
Pubblicazione: (2025)
WWW.Serve: Interconnecting Global LLM Services through Decentralization
di: Wang, Huanyu, et al.
Pubblicazione: (2026)
di: Wang, Huanyu, et al.
Pubblicazione: (2026)
Designing Co-operation in Systems of Hierarchical, Multi-objective Schedulers for Stream Processing
di: Dangwal, Animesh, et al.
Pubblicazione: (2025)
di: Dangwal, Animesh, et al.
Pubblicazione: (2025)
NestedFP: High-Performance, Memory-Efficient Dual-Precision Floating Point Support for LLMs
di: Lee, Haeun, et al.
Pubblicazione: (2025)
di: Lee, Haeun, et al.
Pubblicazione: (2025)
Not All Federated Learning Algorithms Are Created Equal: A Performance Evaluation Study
di: Baumgart, Gustav A., et al.
Pubblicazione: (2024)
di: Baumgart, Gustav A., et al.
Pubblicazione: (2024)
Agentic AI-Driven UAV Network Deployment: An LLM-Enhanced Exact Potential Game Approach
di: Tang, Xin, et al.
Pubblicazione: (2026)
di: Tang, Xin, et al.
Pubblicazione: (2026)
GENSERVE: Efficient Co-Serving of Heterogeneous Diffusion Model Workloads
di: Ye, Fanjiang, et al.
Pubblicazione: (2026)
di: Ye, Fanjiang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Kareus: Joint Reduction of Dynamic and Static Energy in Large Model Training
di: Wu, Ruofan, et al.
Pubblicazione: (2026) -
Cornserve: A Distributed Serving System for Any-to-Any Multimodal Models
di: Chung, Jae-Won, et al.
Pubblicazione: (2026) -
Where Do the Joules Go? Diagnosing Inference Energy Consumption
di: Chung, Jae-Won, et al.
Pubblicazione: (2026) -
Toward Cross-Layer Energy Optimizations in AI Systems
di: Chung, Jae-Won, et al.
Pubblicazione: (2024) -
Cornfigurator: Automated Planning for Any-to-Any Multimodal Model Serving
di: Ma, Jeff J., et al.
Pubblicazione: (2025)