Ensuring Fair LLM Serving Amid Diverse Applications
Fuente:
arXiv
Salvato in:
| Autori principali: | Khan, Redwan Ibne Seraj, Jain, Kunal, Shen, Haiying, Mallick, Ankur, Parayil, Anjaly, Kulkarni, Anoop, Kofsky, Steve, Choudhary, Pankhuri, Amant, Renèe St., Wang, Rujia, Cheng, Yue, Butt, Ali R., Rühle, Victor, Bansal, Chetan, Rajmohan, Saravan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SageServe: Optimizing LLM Serving on Cloud Data Centers with Forecast Aware Auto-Scaling
di: Jaiswal, Shashwat, et al.
Pubblicazione: (2025)
di: Jaiswal, Shashwat, et al.
Pubblicazione: (2025)
Intelligent Router for LLM Workloads: Improving Performance Through Workload-Aware Load Balancing
di: Jain, Kunal, et al.
Pubblicazione: (2024)
di: Jain, Kunal, et al.
Pubblicazione: (2024)
Attention Enhanced Entity Recommendation for Intelligent Monitoring in Cloud Systems
di: Hussain, Fiza, et al.
Pubblicazione: (2025)
di: Hussain, Fiza, et al.
Pubblicazione: (2025)
Serving Heterogeneous LoRA Adapters in Distributed LLM Inference Systems
di: Jaiswal, Shashwat, et al.
Pubblicazione: (2025)
di: Jaiswal, Shashwat, et al.
Pubblicazione: (2025)
Lean Attention: Hardware-Aware Scalable Attention Mechanism for the Decode-Phase of Transformers
di: Sanovar, Rya, et al.
Pubblicazione: (2024)
di: Sanovar, Rya, et al.
Pubblicazione: (2024)
Intelligent Monitoring Framework for Cloud Services: A Data-Driven Approach
di: Srinivas, Pooja, et al.
Pubblicazione: (2024)
di: Srinivas, Pooja, et al.
Pubblicazione: (2024)
A Holistic Framework for Automated Configuration Recommendation for Cloud Service Monitoring
di: Bastos, Anson, et al.
Pubblicazione: (2026)
di: Bastos, Anson, et al.
Pubblicazione: (2026)
X-lifecycle Learning for Cloud Incident Management using LLMs
di: Goel, Drishti, et al.
Pubblicazione: (2024)
di: Goel, Drishti, et al.
Pubblicazione: (2024)
Memora: A Harmonic Memory Representation Balancing Abstraction and Specificity
di: Xia, Menglin, et al.
Pubblicazione: (2026)
di: Xia, Menglin, et al.
Pubblicazione: (2026)
Semantic Caching of Contextual Summaries for Efficient Question-Answering with Language Models
di: Couturier, Camille, et al.
Pubblicazione: (2025)
di: Couturier, Camille, et al.
Pubblicazione: (2025)
Cost-Aware Retrieval-Augmentation Reasoning Models with Adaptive Retrieval Depth
di: Hashemi, Helia, et al.
Pubblicazione: (2025)
di: Hashemi, Helia, et al.
Pubblicazione: (2025)
Automated Root Causing of Cloud Incidents using In-Context Learning with GPT-4
di: Zhang, Xuchao, et al.
Pubblicazione: (2024)
di: Zhang, Xuchao, et al.
Pubblicazione: (2024)
10Cache: Heterogeneous Resource-Aware Tensor Caching and Migration for LLM Training
di: Afroz, Sabiha, et al.
Pubblicazione: (2025)
di: Afroz, Sabiha, et al.
Pubblicazione: (2025)
AMPO: Active Multi-Preference Optimization for Self-play Preference Selection
di: Gupta, Taneesh, et al.
Pubblicazione: (2025)
di: Gupta, Taneesh, et al.
Pubblicazione: (2025)
REFA: Reference Free Alignment for multi-preference optimization
di: Gupta, Taneesh, et al.
Pubblicazione: (2024)
di: Gupta, Taneesh, et al.
Pubblicazione: (2024)
Exploring How LLMs Capture and Represent Domain-Specific Knowledge
di: Garcia, Mirian Hipolito, et al.
Pubblicazione: (2025)
di: Garcia, Mirian Hipolito, et al.
Pubblicazione: (2025)
Towards Cloud Efficiency with Large-scale Workload Characterization
di: Parayil, Anjaly, et al.
Pubblicazione: (2024)
di: Parayil, Anjaly, et al.
Pubblicazione: (2024)
AIOpsLab: A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds
di: Chen, Yinfang, et al.
Pubblicazione: (2025)
di: Chen, Yinfang, et al.
Pubblicazione: (2025)
Hybrid Learning and Optimization-Based Dynamic Scheduling for DL Workloads on Heterogeneous GPU Clusters
di: Dongare, Shruti, et al.
Pubblicazione: (2025)
di: Dongare, Shruti, et al.
Pubblicazione: (2025)
Sutradhara: An Intelligent Orchestrator-Engine Co-design for Tool-based Agentic Inference
di: Biswas, Anish, et al.
Pubblicazione: (2026)
di: Biswas, Anish, et al.
Pubblicazione: (2026)
Revisiting Transformer Layer Parameterization Through Causal Energy Minimization
di: Xu, Jin, et al.
Pubblicazione: (2026)
di: Xu, Jin, et al.
Pubblicazione: (2026)
AutoAdapt: An Automated Domain Adaptation Framework for LLMs
di: Sinha, Sidharth, et al.
Pubblicazione: (2026)
di: Sinha, Sidharth, et al.
Pubblicazione: (2026)
Multi-Preference Optimization: Generalizing DPO via Set-Level Contrasts
di: Gupta, Taneesh, et al.
Pubblicazione: (2024)
di: Gupta, Taneesh, et al.
Pubblicazione: (2024)
Synergistic Weak-Strong Collaboration by Aligning Preferences
di: Jiao, Yizhu, et al.
Pubblicazione: (2025)
di: Jiao, Yizhu, et al.
Pubblicazione: (2025)
Gaussian beams and inverse problems for connections at high fixed frequency
di: St-Amant, Simon
Pubblicazione: (2024)
di: St-Amant, Simon
Pubblicazione: (2024)
The Gulf States Marine Fisheries Commission and the Menhaden Fishery
di: St. Amant, L.S.
Pubblicazione: (1974)
di: St. Amant, L.S.
Pubblicazione: (1974)
TurboAttention: Efficient Attention Approximation For High Throughputs LLMs
di: Kang, Hao, et al.
Pubblicazione: (2024)
di: Kang, Hao, et al.
Pubblicazione: (2024)
Hybrid-RACA: Hybrid Retrieval-Augmented Composition Assistance for Real-time Text Prediction
di: Xia, Menglin, et al.
Pubblicazione: (2023)
di: Xia, Menglin, et al.
Pubblicazione: (2023)
Workload Intelligence: Punching Holes Through the Cloud Abstraction
di: Huang, Lexiang, et al.
Pubblicazione: (2024)
di: Huang, Lexiang, et al.
Pubblicazione: (2024)
Dependency Aware Incident Linking in Large Cloud Systems
di: Ghosh, Supriyo, et al.
Pubblicazione: (2024)
di: Ghosh, Supriyo, et al.
Pubblicazione: (2024)
LEGOMem: Modular Procedural Memory for Multi-agent LLM Systems for Workflow Automation
di: Han, Dongge, et al.
Pubblicazione: (2025)
di: Han, Dongge, et al.
Pubblicazione: (2025)
OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows
di: Wang, Weixuan, et al.
Pubblicazione: (2025)
di: Wang, Weixuan, et al.
Pubblicazione: (2025)
Enhancing Reasoning Capabilities of Small Language Models with Blueprints and Prompt Template Search
di: Han, Dongge, et al.
Pubblicazione: (2025)
di: Han, Dongge, et al.
Pubblicazione: (2025)
Exploring LLM-based Agents for Root Cause Analysis
di: Roy, Devjeet, et al.
Pubblicazione: (2024)
di: Roy, Devjeet, et al.
Pubblicazione: (2024)
SynthAgent: Adapting Web Agents with Synthetic Supervision
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
Budget-Aware Agentic Routing via Boundary-Guided Training
di: Zhang, Caiqi, et al.
Pubblicazione: (2026)
di: Zhang, Caiqi, et al.
Pubblicazione: (2026)
CARMO: Dynamic Criteria Generation for Context-Aware Reward Modelling
di: Gupta, Taneesh, et al.
Pubblicazione: (2024)
di: Gupta, Taneesh, et al.
Pubblicazione: (2024)
EvidenT: An Evidence-Preserving Framework for Iterative System-Level Package Repair
di: Zhao, Chenyu, et al.
Pubblicazione: (2026)
di: Zhao, Chenyu, et al.
Pubblicazione: (2026)
eARCO: Efficient Automated Root Cause Analysis with Prompt Optimization
di: Goel, Drishti, et al.
Pubblicazione: (2025)
di: Goel, Drishti, et al.
Pubblicazione: (2025)
An Empirical Study of Production Incidents in Generative AI Cloud Services
di: Yan, Haoran, et al.
Pubblicazione: (2025)
di: Yan, Haoran, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SageServe: Optimizing LLM Serving on Cloud Data Centers with Forecast Aware Auto-Scaling
di: Jaiswal, Shashwat, et al.
Pubblicazione: (2025) -
Intelligent Router for LLM Workloads: Improving Performance Through Workload-Aware Load Balancing
di: Jain, Kunal, et al.
Pubblicazione: (2024) -
Attention Enhanced Entity Recommendation for Intelligent Monitoring in Cloud Systems
di: Hussain, Fiza, et al.
Pubblicazione: (2025) -
Serving Heterogeneous LoRA Adapters in Distributed LLM Inference Systems
di: Jaiswal, Shashwat, et al.
Pubblicazione: (2025) -
Lean Attention: Hardware-Aware Scalable Attention Mechanism for the Decode-Phase of Transformers
di: Sanovar, Rya, et al.
Pubblicazione: (2024)