TailBench++: Flexible Multi-Client, Multi-Server Benchmarking for Latency-Critical Workloads
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Zhilin, Pons, Lucia, Petit, Salvador, Sahuquillo, Julio, Pons, Julio |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Prefetching in Deep Memory Hierarchies with NVRAM as Main Memory
par: Lurbe, Manel, et autres
Publié: (2025)
par: Lurbe, Manel, et autres
Publié: (2025)
A New Family of Thread to Core Allocation Policies for an SMT ARM Processor
par: Navarro, Marta, et autres
Publié: (2025)
par: Navarro, Marta, et autres
Publié: (2025)
Optimal Workload Placement on Multi-Instance GPUs
par: Turkkan, Bekir, et autres
Publié: (2024)
par: Turkkan, Bekir, et autres
Publié: (2024)
Shift Parallelism: Low-Latency, High-Throughput LLM Inference for Dynamic Workloads
par: Hidayetoglu, Mert, et autres
Publié: (2025)
par: Hidayetoglu, Mert, et autres
Publié: (2025)
Dynamic Client Clustering, Bandwidth Allocation, and Workload Optimization for Semi-synchronous Federated Learning
par: Yu, Liangkun, et autres
Publié: (2024)
par: Yu, Liangkun, et autres
Publié: (2024)
LA-IMR: Latency-Aware, Predictive In-Memory Routing and Proactive Autoscaling for Tail-Latency-Sensitive Cloud Robotics
par: Seo, Eunil, et autres
Publié: (2025)
par: Seo, Eunil, et autres
Publié: (2025)
Accelerating Heterogeneous Tensor Parallelism via Flexible Workload Control
par: Wang, Zhigang, et autres
Publié: (2024)
par: Wang, Zhigang, et autres
Publié: (2024)
Workload Distribution with Rateless Encoding: A Low-Latency Computation Offloading Method within Edge Networks
par: Guo, Zhongfu, et autres
Publié: (2023)
par: Guo, Zhongfu, et autres
Publié: (2023)
Areon: Latency-Friendly and Resilient Multi-Proposer Consensus
par: Castro-Castilla, Álvaro, et autres
Publié: (2025)
par: Castro-Castilla, Álvaro, et autres
Publié: (2025)
Orchestrating Mixed-Criticality Cloud Workloads in Reconfigurable Manufacturing Systems
par: Barletta, Marco, et autres
Publié: (2024)
par: Barletta, Marco, et autres
Publié: (2024)
An Online Fragmentation-Aware Scheduler for Managing GPU-Sharing Workloads on Multi-Instance GPUs
par: Ting, Hsu-Tzu, et autres
Publié: (2025)
par: Ting, Hsu-Tzu, et autres
Publié: (2025)
Asynchronous Multi-Server Federated Learning for Geo-Distributed Clients
par: Zuo, Yuncong, et autres
Publié: (2024)
par: Zuo, Yuncong, et autres
Publié: (2024)
Reducing Tail Latencies Through Environment- and Neighbour-aware Thread Management
par: Jeffery, Andrew, et autres
Publié: (2024)
par: Jeffery, Andrew, et autres
Publié: (2024)
Understanding Server-Assisted Federated Learning in the Presence of Incomplete Client Participation
par: Yang, Haibo, et autres
Publié: (2024)
par: Yang, Haibo, et autres
Publié: (2024)
SWARM+: Scalable and Resilient Multi-Agent Consensus for Fully-Decentralized Data-Aware Workload Management
par: Thareja, Komal, et autres
Publié: (2026)
par: Thareja, Komal, et autres
Publié: (2026)
Scene-Aware Latency Estimation for Microservices via Multi-Scale Graph Fusion
par: Sun, Zhichao, et autres
Publié: (2026)
par: Sun, Zhichao, et autres
Publié: (2026)
Design and Implementation of a Java-Based Client-Server Application
par: Patil, Omkar, et autres
Publié: (2024)
par: Patil, Omkar, et autres
Publié: (2024)
Are Bus-Mounted Edge Servers Feasible?
par: Li, Xuezhi, et autres
Publié: (2025)
par: Li, Xuezhi, et autres
Publié: (2025)
CycleSL: Server-Client Cyclical Update Driven Scalable Split Learning
par: Wang, Mengdi, et autres
Publié: (2025)
par: Wang, Mengdi, et autres
Publié: (2025)
MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production
par: Xue, Chunyu, et autres
Publié: (2026)
par: Xue, Chunyu, et autres
Publié: (2026)
FaaS Is Not Enough: Serverless Handling of Burst-Parallel Jobs
par: Barcelona-Pons, Daniel, et autres
Publié: (2024)
par: Barcelona-Pons, Daniel, et autres
Publié: (2024)
Many Hands Make Light Work: Accelerating Edge Inference via Multi-Client Collaborative Caching
par: Liang, Wenyi, et autres
Publié: (2024)
par: Liang, Wenyi, et autres
Publié: (2024)
Agentic AI Workload Characteristics
par: Yuan, Yichao, et autres
Publié: (2026)
par: Yuan, Yichao, et autres
Publié: (2026)
Practical Federated Learning without a Server
par: Dhasade, Akash, et autres
Publié: (2025)
par: Dhasade, Akash, et autres
Publié: (2025)
Accelerating Compound LLM Training Workloads with Maestro
par: Yuan, Xiulong, et autres
Publié: (2026)
par: Yuan, Xiulong, et autres
Publié: (2026)
ElastiBench: Scalable Continuous Benchmarking on Cloud FaaS Platforms
par: Schirmer, Trever, et autres
Publié: (2024)
par: Schirmer, Trever, et autres
Publié: (2024)
Experimental Analysis of Server-Side Caching for Web Performance
par: Umar, Mohammad, et autres
Publié: (2026)
par: Umar, Mohammad, et autres
Publié: (2026)
SCARIF: Towards Carbon Modeling of Cloud Servers with Accelerators
par: Ji, Shixin, et autres
Publié: (2024)
par: Ji, Shixin, et autres
Publié: (2024)
Delay-Aware Multi-Stage Edge Server Upgrade with Budget Constraint
par: Wihidayat, Endar Suprih, et autres
Publié: (2025)
par: Wihidayat, Endar Suprih, et autres
Publié: (2025)
SECO: Secure Inference With Model Splitting Across Multi-Server Hierarchy
par: Chen, Shuangyi, et autres
Publié: (2024)
par: Chen, Shuangyi, et autres
Publié: (2024)
Ocularone-Bench: Benchmarking DNN Models on GPUs to Assist the Visually Impaired
par: Raj, Suman, et autres
Publié: (2025)
par: Raj, Suman, et autres
Publié: (2025)
CRIUgpu: Transparent Checkpointing of GPU-Accelerated Workloads
par: Stoyanov, Radostin, et autres
Publié: (2025)
par: Stoyanov, Radostin, et autres
Publié: (2025)
AI Surrogate Model for Distributed Computing Workloads
par: Park, David K., et autres
Publié: (2024)
par: Park, David K., et autres
Publié: (2024)
Bridging Memory Gaps: Scaling Federated Learning for Heterogeneous Clients
par: Wu, Yebo, et autres
Publié: (2024)
par: Wu, Yebo, et autres
Publié: (2024)
Risk-Aware and Stable Edge Server Selection Under Network Latency SLOs
par: Liyanage, Mohan, et autres
Publié: (2026)
par: Liyanage, Mohan, et autres
Publié: (2026)
GENSERVE: Efficient Co-Serving of Heterogeneous Diffusion Model Workloads
par: Ye, Fanjiang, et autres
Publié: (2026)
par: Ye, Fanjiang, et autres
Publié: (2026)
Analysis of Server Throughput For Managed Big Data Analytics Frameworks
par: Anagnostakis, Emmanouil, et autres
Publié: (2025)
par: Anagnostakis, Emmanouil, et autres
Publié: (2025)
MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments
par: Liu, Guangyi, et autres
Publié: (2026)
par: Liu, Guangyi, et autres
Publié: (2026)
Crossword: Adaptive Consensus for Dynamic Data-Heavy Workloads
par: Hu, Guanzhou, et autres
Publié: (2025)
par: Hu, Guanzhou, et autres
Publié: (2025)
Data Management System Analysis for Distributed Computing Workloads
par: Hsu, Kuan-Chieh, et autres
Publié: (2025)
par: Hsu, Kuan-Chieh, et autres
Publié: (2025)
Documents similaires
-
Prefetching in Deep Memory Hierarchies with NVRAM as Main Memory
par: Lurbe, Manel, et autres
Publié: (2025) -
A New Family of Thread to Core Allocation Policies for an SMT ARM Processor
par: Navarro, Marta, et autres
Publié: (2025) -
Optimal Workload Placement on Multi-Instance GPUs
par: Turkkan, Bekir, et autres
Publié: (2024) -
Shift Parallelism: Low-Latency, High-Throughput LLM Inference for Dynamic Workloads
par: Hidayetoglu, Mert, et autres
Publié: (2025) -
Dynamic Client Clustering, Bandwidth Allocation, and Workload Optimization for Semi-synchronous Federated Learning
par: Yu, Liangkun, et autres
Publié: (2024)