Why Should the Server Do It All?: A Scalable, Versatile, and Model-Agnostic Framework for Server-Light DNN Inference over Massively Distributed Clients via Training-Free Intermediate Feature Compression
Fuente:
arXiv
Saved in:
| Main Authors: | Sung, Mingyu, Im, Suhwan, Bang, Daeho, Kim, Il-Min, Yun, Sangseok, Kang, Jae-Mo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Range Asymmetric Numeral Systems-Based Lightweight Intermediate Feature Compression for Split Computing of Deep Neural Networks
by: Sung, Mingyu, et al.
Published: (2025)
by: Sung, Mingyu, et al.
Published: (2025)
Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing
by: Sung, Mingyu, et al.
Published: (2025)
by: Sung, Mingyu, et al.
Published: (2025)
No Pose Estimation? No Problem: Pose-Agnostic and Instance-Aware Test-Time Adaptation for Monocular Depth Estimation
by: Sung, Mingyu, et al.
Published: (2025)
by: Sung, Mingyu, et al.
Published: (2025)
H2-Cache: A Novel Hierarchical Dual-Stage Cache for High-Performance Acceleration of Generative Diffusion Models
by: Sung, Mingyu, et al.
Published: (2025)
by: Sung, Mingyu, et al.
Published: (2025)
Beyond Inference: Performance Analysis of DNN Server Overheads for Computer Vision
by: AbouElhamayed, Ahmed F., et al.
Published: (2024)
by: AbouElhamayed, Ahmed F., et al.
Published: (2024)
NatServer: A Client-Server Architecture for building Parallel Corpora applications
by: Alberto Simões
Published: (2006)
by: Alberto Simões
Published: (2006)
Systems Librarians and the Client/Server Environment.
by: Ross, Mary, et al.
Published: (2000)
by: Ross, Mary, et al.
Published: (2000)
Verification of Unbounded Client-Server Systems with Distinguishable Clients
by: Phawade, Ramchandra, et al.
Published: (2026)
by: Phawade, Ramchandra, et al.
Published: (2026)
CycleSL: Server-Client Cyclical Update Driven Scalable Split Learning
by: Wang, Mengdi, et al.
Published: (2025)
by: Wang, Mengdi, et al.
Published: (2025)
GLYPH-SR: Can We Achieve Both High-Quality Image Super-Resolution and High-Fidelity Text Recovery via VLM-guided Latent Diffusion Model?
by: Sung, Mingyu, et al.
Published: (2025)
by: Sung, Mingyu, et al.
Published: (2025)
Robust Client-Server Watermarking for Split Federated Learning
by: Tang, Jiaxiong, et al.
Published: (2025)
by: Tang, Jiaxiong, et al.
Published: (2025)
Bounded Model Checking for Unbounded Client Server Systems
by: Phawade, Ramchandra, et al.
Published: (2022)
by: Phawade, Ramchandra, et al.
Published: (2022)
Design and Implementation of a Java-Based Client-Server Application
by: Patil, Omkar, et al.
Published: (2024)
by: Patil, Omkar, et al.
Published: (2024)
Conflict-Aware Client Selection for Multi-Server Federated Learning
by: Hong, Mingwei, et al.
Published: (2026)
by: Hong, Mingwei, et al.
Published: (2026)
Asynchronous Multi-Server Federated Learning for Geo-Distributed Clients
by: Zuo, Yuncong, et al.
Published: (2024)
by: Zuo, Yuncong, et al.
Published: (2024)
Ecomap: Sustainability-Driven Optimization of Multi-Tenant DNN Execution on Edge Servers
by: Paramanayakam, Varatheepan, et al.
Published: (2025)
by: Paramanayakam, Varatheepan, et al.
Published: (2025)
Bandwidth-Efficient Two-Server ORAMs with O(1) Client Storage
by: Wang, Wei, et al.
Published: (2025)
by: Wang, Wei, et al.
Published: (2025)
Understanding Server-Assisted Federated Learning in the Presence of Incomplete Client Participation
by: Yang, Haibo, et al.
Published: (2024)
by: Yang, Haibo, et al.
Published: (2024)
Crayon: Customized On-Device LLM via Instant Adapter Blending and Edge-Server Hybrid Inference
by: Bang, Jihwan, et al.
Published: (2024)
by: Bang, Jihwan, et al.
Published: (2024)
Gated Infinite Server Queues in Light Traffic
by: Pinotsi, Dimitra, et al.
Published: (2026)
by: Pinotsi, Dimitra, et al.
Published: (2026)
DRAW Server
by: Chakraborty, Santam, et al.
Published: (2026)
by: Chakraborty, Santam, et al.
Published: (2026)
Multi-Server FL with Overlapping Clients: A Latency-Aware Relay Framework
by: Ji, Yun, et al.
Published: (2025)
by: Ji, Yun, et al.
Published: (2025)
VDDP: Verifiable Distributed Differential Privacy under the Client-Server-Verifier Setup
by: Sun, Haochen, et al.
Published: (2025)
by: Sun, Haochen, et al.
Published: (2025)
CoLM: Collaborative Large Models via A Client-Server Paradigm
by: Huang, Siqi, et al.
Published: (2025)
by: Huang, Siqi, et al.
Published: (2025)
Collaborative Edge-to-Server Inference for Vision-Language Models
by: Song, Soochang, et al.
Published: (2025)
by: Song, Soochang, et al.
Published: (2025)
VLAgents: A Policy Server for Efficient VLA Inference
by: Jülg, Tobias, et al.
Published: (2026)
by: Jülg, Tobias, et al.
Published: (2026)
Scalable and Secure AI Inference in Healthcare: A Comparative Benchmarking of FastAPI and Triton Inference Server on Kubernetes
by: Ali, Ratul
Published: (2026)
by: Ali, Ratul
Published: (2026)
Explicit Steady-State Approximations for Parallel Server Systems with Heterogeneous Servers
by: Xu, Yaosheng
Published: (2024)
by: Xu, Yaosheng
Published: (2024)
Many-Server Queueing Systems with Heterogeneous Strategic Servers in Heavy Traffic
by: Büke, Burak, et al.
Published: (2022)
by: Büke, Burak, et al.
Published: (2022)
Communication Compression for Distributed Learning with Aggregate and Server-Guided Feedback
by: Ortega, Tomas, et al.
Published: (2025)
by: Ortega, Tomas, et al.
Published: (2025)
TailBench++: Flexible Multi-Client, Multi-Server Benchmarking for Latency-Critical Workloads
by: Li, Zhilin, et al.
Published: (2025)
by: Li, Zhilin, et al.
Published: (2025)
FedOC: Multi-Server FL with Overlapping Client Relays in Wireless Edge Networks
by: Ji, Yun, et al.
Published: (2025)
by: Ji, Yun, et al.
Published: (2025)
DataFormatServer
by: Khokhriakov, Igor
Published: (2025)
by: Khokhriakov, Igor
Published: (2025)
Queues with Rechargeable Servers
by: Fuentes-Quezada, Eliezer, et al.
Published: (2026)
by: Fuentes-Quezada, Eliezer, et al.
Published: (2026)
Energy Efficient Servers
by: Gough, Corey, et al.
Published: (2018)
by: Gough, Corey, et al.
Published: (2018)
IVE: An Accelerator for Single-Server Private Information Retrieval Using Versatile Processing Elements
by: Kim, Sangpyo, et al.
Published: (2025)
by: Kim, Sangpyo, et al.
Published: (2025)
Taming Server Memory TCO with Multiple Software-Defined Compressed Tiers
by: Kumar, Sandeep, et al.
Published: (2024)
by: Kumar, Sandeep, et al.
Published: (2024)
Federated Knowledge Transfer Fine-tuning Large Server Model with Resource-Constrained IoT Clients
by: Chen, Shaoyuan, et al.
Published: (2024)
by: Chen, Shaoyuan, et al.
Published: (2024)
FedSCAl: Leveraging Server and Client Alignment for Unsupervised Federated Source-Free Domain Adaptation
by: Yashwanth, M, et al.
Published: (2025)
by: Yashwanth, M, et al.
Published: (2025)
Robust Server Defense Against Unreliable Clients in One-Shot Fair Collaborative Machine Learning
by: Wu, Chia-Yuan, et al.
Published: (2026)
by: Wu, Chia-Yuan, et al.
Published: (2026)
Similar Items
-
Range Asymmetric Numeral Systems-Based Lightweight Intermediate Feature Compression for Split Computing of Deep Neural Networks
by: Sung, Mingyu, et al.
Published: (2025) -
Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing
by: Sung, Mingyu, et al.
Published: (2025) -
No Pose Estimation? No Problem: Pose-Agnostic and Instance-Aware Test-Time Adaptation for Monocular Depth Estimation
by: Sung, Mingyu, et al.
Published: (2025) -
H2-Cache: A Novel Hierarchical Dual-Stage Cache for High-Performance Acceleration of Generative Diffusion Models
by: Sung, Mingyu, et al.
Published: (2025) -
Beyond Inference: Performance Analysis of DNN Server Overheads for Computer Vision
by: AbouElhamayed, Ahmed F., et al.
Published: (2024)