TetriServe: Efficient DiT Serving for Heterogeneous Image Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Lu, Runyu, He, Shiqi, Tan, Wenxuan, Li, Shenggui, Wu, Ruofan, Ma, Jeff J., Chen, Ang, Chowdhury, Mosharaf |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Efficient Distributed MLLM Training with Cornstarch
di: Jang, Insu, et al.
Pubblicazione: (2025)
di: Jang, Insu, et al.
Pubblicazione: (2025)
Cornfigurator: Automated Planning for Any-to-Any Multimodal Model Serving
di: Ma, Jeff J., et al.
Pubblicazione: (2025)
di: Ma, Jeff J., et al.
Pubblicazione: (2025)
KAIROS: Stateful, Context-Aware Power-Efficient Agentic Inference Serving
di: Yuan, Yichao, et al.
Pubblicazione: (2026)
di: Yuan, Yichao, et al.
Pubblicazione: (2026)
Cornserve: A Distributed Serving System for Any-to-Any Multimodal Models
di: Chung, Jae-Won, et al.
Pubblicazione: (2026)
di: Chung, Jae-Won, et al.
Pubblicazione: (2026)
Addressing Variable Heterogeneity in Distributed Multimodal Training with Entrain
di: Jang, Insu, et al.
Pubblicazione: (2026)
di: Jang, Insu, et al.
Pubblicazione: (2026)
MuxServe: Flexible Spatial-Temporal Multiplexing for Multiple LLM Serving
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
DiT-HC: Enabling Efficient Training of Visual Generation Model DiT on HPC-oriented CPU Cluster
di: Zhang, Jinxiao, et al.
Pubblicazione: (2026)
di: Zhang, Jinxiao, et al.
Pubblicazione: (2026)
Where Do the Joules Go? Diagnosing Inference Energy Consumption
di: Chung, Jae-Won, et al.
Pubblicazione: (2026)
di: Chung, Jae-Won, et al.
Pubblicazione: (2026)
GENSERVE: Efficient Co-Serving of Heterogeneous Diffusion Model Workloads
di: Ye, Fanjiang, et al.
Pubblicazione: (2026)
di: Ye, Fanjiang, et al.
Pubblicazione: (2026)
Kareus: Joint Reduction of Dynamic and Static Energy in Large Model Training
di: Wu, Ruofan, et al.
Pubblicazione: (2026)
di: Wu, Ruofan, et al.
Pubblicazione: (2026)
FREESH: Fair, Resource- and Energy-Efficient Scheduling for LLM Serving on Heterogeneous GPUs
di: He, Xuan, et al.
Pubblicazione: (2025)
di: He, Xuan, et al.
Pubblicazione: (2025)
DiffServe: Efficiently Serving Text-to-Image Diffusion Models with Query-Aware Model Scaling
di: Ahmad, Sohaib, et al.
Pubblicazione: (2024)
di: Ahmad, Sohaib, et al.
Pubblicazione: (2024)
GoodServe: Towards High-Goodput Serving of Agentic LLM Inferences over Heterogeneous Resources
di: Du, Boxiao, et al.
Pubblicazione: (2026)
di: Du, Boxiao, et al.
Pubblicazione: (2026)
Demystifying Cost-Efficiency in LLM Serving over Heterogeneous GPUs
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
HADIS: Hybrid Adaptive Diffusion Model Serving for Efficient Text-to-Image Generation
di: Yang, Qizheng, et al.
Pubblicazione: (2025)
di: Yang, Qizheng, et al.
Pubblicazione: (2025)
MoDM: Efficient Serving for Image Generation via Mixture-of-Diffusion Models
di: Xia, Yuchen, et al.
Pubblicazione: (2025)
di: Xia, Yuchen, et al.
Pubblicazione: (2025)
CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference
di: Li, Suyi, et al.
Pubblicazione: (2024)
di: Li, Suyi, et al.
Pubblicazione: (2024)
ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production
di: Xiang, Yuxing, et al.
Pubblicazione: (2025)
di: Xiang, Yuxing, et al.
Pubblicazione: (2025)
Jenga: Effective Memory Management for Serving LLM with Heterogeneity
di: Zhang, Chen, et al.
Pubblicazione: (2025)
di: Zhang, Chen, et al.
Pubblicazione: (2025)
Toward Cost-Efficient Serving of Mixture-of-Experts with Asynchrony
di: Wang, Shaoyu, et al.
Pubblicazione: (2025)
di: Wang, Shaoyu, et al.
Pubblicazione: (2025)
DeepServe: Serverless Large Language Model Serving at Scale
di: Hu, Junhao, et al.
Pubblicazione: (2025)
di: Hu, Junhao, et al.
Pubblicazione: (2025)
HexAGenT: Efficient Agentic LLM Serving via Workflow- and Heterogeneity-Aware Scheduling
di: Peng, You, et al.
Pubblicazione: (2026)
di: Peng, You, et al.
Pubblicazione: (2026)
UELLM: A Unified and Efficient Approach for LLM Inference Serving
di: He, Yiyuan, et al.
Pubblicazione: (2024)
di: He, Yiyuan, et al.
Pubblicazione: (2024)
BanaServe: Unified KV Cache and Dynamic Module Migration for Balancing Disaggregated LLM Serving in AI Infrastructure
di: He, Yiyuan, et al.
Pubblicazione: (2025)
di: He, Yiyuan, et al.
Pubblicazione: (2025)
Efficient Multi-round LLM Inference over Disaggregated Serving
di: He, Wenhao, et al.
Pubblicazione: (2026)
di: He, Wenhao, et al.
Pubblicazione: (2026)
EdgeServing: Deadline-Aware Multi-DNN Serving at the Edge
di: Cao, Jiahe, et al.
Pubblicazione: (2026)
di: Cao, Jiahe, et al.
Pubblicazione: (2026)
EcoServe: Enabling Cost-effective LLM Serving with Proactive Intra- and Inter-Instance Orchestration
di: Du, Jiangsu, et al.
Pubblicazione: (2025)
di: Du, Jiangsu, et al.
Pubblicazione: (2025)
Enabling Efficient Batch Serving for LMaaS via Generation Length Prediction
di: Cheng, Ke, et al.
Pubblicazione: (2024)
di: Cheng, Ke, et al.
Pubblicazione: (2024)
AgentServe: Algorithm-System Co-Design for Efficient Agentic AI Serving on a Consumer-Grade GPU
di: Zhang, Yuning, et al.
Pubblicazione: (2026)
di: Zhang, Yuning, et al.
Pubblicazione: (2026)
PolyServe: Efficient Multi-SLO Serving at Scale
di: Zhu, Kan, et al.
Pubblicazione: (2025)
di: Zhu, Kan, et al.
Pubblicazione: (2025)
DynaServe: Unified and Elastic Execution for Dynamic Disaggregated LLM Serving
di: Ruan, Chaoyi, et al.
Pubblicazione: (2025)
di: Ruan, Chaoyi, et al.
Pubblicazione: (2025)
TridentServe: A Stage-level Serving System for Diffusion Pipelines
di: Xia, Yifei, et al.
Pubblicazione: (2025)
di: Xia, Yifei, et al.
Pubblicazione: (2025)
BOute: Cost-Efficient LLM Serving with Heterogeneous LLMs and GPUs via Multi-Objective Bayesian Optimization
di: Jiang, Youhe, et al.
Pubblicazione: (2026)
di: Jiang, Youhe, et al.
Pubblicazione: (2026)
PPipe: Efficient Video Analytics Serving on Heterogeneous GPU Clusters via Pool-Based Pipeline Parallelism
di: Kong, Z. Jonny, et al.
Pubblicazione: (2025)
di: Kong, Z. Jonny, et al.
Pubblicazione: (2025)
MixServe: An Automatic Distributed Serving System for MoE Models with Hybrid Parallelism Based on Fused Communication Algorithm
di: Zhou, Bowen, et al.
Pubblicazione: (2026)
di: Zhou, Bowen, et al.
Pubblicazione: (2026)
MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool
di: Hu, Cunchen, et al.
Pubblicazione: (2024)
di: Hu, Cunchen, et al.
Pubblicazione: (2024)
EconoServe: Maximizing Multi-Resource Utilization with SLO Guarantees in LLM Serving
di: Shen, Haiying, et al.
Pubblicazione: (2024)
di: Shen, Haiying, et al.
Pubblicazione: (2024)
ThunderServe: High-performance and Cost-efficient LLM Serving in Cloud Environments
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
AlignedServe: Orchestrating Prefix-aware Batching to Build a High-throughput and Computing-efficient LLM Serving System
di: Bai, Fengyao, et al.
Pubblicazione: (2026)
di: Bai, Fengyao, et al.
Pubblicazione: (2026)
Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism
di: Mo, Zizhao, et al.
Pubblicazione: (2025)
di: Mo, Zizhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Efficient Distributed MLLM Training with Cornstarch
di: Jang, Insu, et al.
Pubblicazione: (2025) -
Cornfigurator: Automated Planning for Any-to-Any Multimodal Model Serving
di: Ma, Jeff J., et al.
Pubblicazione: (2025) -
KAIROS: Stateful, Context-Aware Power-Efficient Agentic Inference Serving
di: Yuan, Yichao, et al.
Pubblicazione: (2026) -
Cornserve: A Distributed Serving System for Any-to-Any Multimodal Models
di: Chung, Jae-Won, et al.
Pubblicazione: (2026) -
Addressing Variable Heterogeneity in Distributed Multimodal Training with Entrain
di: Jang, Insu, et al.
Pubblicazione: (2026)