Zipage: Maintain High Request Concurrency for LLM Reasoning through Compressed PagedAttention
Fuente:
arXiv
Salvato in:
| Autori principali: | Liao, Mengqi, Wang, Lu, Zhang, Chaoyun, Qiao, Bo, Qin, Si, Lin, Qingwei, Rajmohan, Saravan, Zhang, Dongmei, Wan, Huaiyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UFO3: Weaving the Digital Agent Galaxy
di: Zhang, Chaoyun, et al.
Pubblicazione: (2025)
di: Zhang, Chaoyun, et al.
Pubblicazione: (2025)
An Empirical Study of Production Incidents in Generative AI Cloud Services
di: Yan, Haoran, et al.
Pubblicazione: (2025)
di: Yan, Haoran, et al.
Pubblicazione: (2025)
An Advanced Reinforcement Learning Framework for Online Scheduling of Deferrable Workloads in Cloud Computing
di: Dong, Hang, et al.
Pubblicazione: (2024)
di: Dong, Hang, et al.
Pubblicazione: (2024)
Deoxys: A Causal Inference Engine for Unhealthy Node Mitigation in Large-scale Cloud Infrastructure
di: Zhang, Chaoyun, et al.
Pubblicazione: (2024)
di: Zhang, Chaoyun, et al.
Pubblicazione: (2024)
The Vision of Autonomic Computing: Can LLMs Make It a Reality?
di: Zhang, Zhiyang, et al.
Pubblicazione: (2024)
di: Zhang, Zhiyang, et al.
Pubblicazione: (2024)
HiCoCS: High Concurrency Cross-Sharding on Permissioned Blockchains
di: Yang, Lingxiao, et al.
Pubblicazione: (2025)
di: Yang, Lingxiao, et al.
Pubblicazione: (2025)
Nitsum: Serving Tiered LLM Requests with Adaptive Tensor Parallelism
di: Srivatsa, Vikranth, et al.
Pubblicazione: (2026)
di: Srivatsa, Vikranth, et al.
Pubblicazione: (2026)
PROSERVE: Unified Multi-Priority Request Scheduling for LLM Serving
di: Huang, Weizhe, et al.
Pubblicazione: (2025)
di: Huang, Weizhe, et al.
Pubblicazione: (2025)
Workload Intelligence: Punching Holes Through the Cloud Abstraction
di: Huang, Lexiang, et al.
Pubblicazione: (2024)
di: Huang, Lexiang, et al.
Pubblicazione: (2024)
Dependency Aware Incident Linking in Large Cloud Systems
di: Ghosh, Supriyo, et al.
Pubblicazione: (2024)
di: Ghosh, Supriyo, et al.
Pubblicazione: (2024)
Hybrid-RACA: Hybrid Retrieval-Augmented Composition Assistance for Real-time Text Prediction
di: Xia, Menglin, et al.
Pubblicazione: (2023)
di: Xia, Menglin, et al.
Pubblicazione: (2023)
PARD: Enhancing Goodput for Inference Pipeline via Proactive Request Dropping
di: Zhao, Zhixin, et al.
Pubblicazione: (2026)
di: Zhao, Zhixin, et al.
Pubblicazione: (2026)
SageServe: Optimizing LLM Serving on Cloud Data Centers with Forecast Aware Auto-Scaling
di: Jaiswal, Shashwat, et al.
Pubblicazione: (2025)
di: Jaiswal, Shashwat, et al.
Pubblicazione: (2025)
StableShard: Stable and Scalable Blockchain Sharding with High Concurrency via Collaborative Committees
di: Li, Mingzhe, et al.
Pubblicazione: (2024)
di: Li, Mingzhe, et al.
Pubblicazione: (2024)
Energy-aware Distributed Microservice Request Placement at the Edge
di: Toczé, Klervie, et al.
Pubblicazione: (2024)
di: Toczé, Klervie, et al.
Pubblicazione: (2024)
Energy Metrics for Edge Microservice Request Placement Strategies
di: Toczé, Klervie, et al.
Pubblicazione: (2025)
di: Toczé, Klervie, et al.
Pubblicazione: (2025)
History-Independent Concurrent Objects
di: Attiya, Hagit, et al.
Pubblicazione: (2024)
di: Attiya, Hagit, et al.
Pubblicazione: (2024)
NanoCP: Request-Level Dynamic Context Parallelism for Data-Expert Parallel Decoding
di: Chen, Jiefei, et al.
Pubblicazione: (2026)
di: Chen, Jiefei, et al.
Pubblicazione: (2026)
AdaOper: Energy-efficient and Responsive Concurrent DNN Inference on Mobile Devices
di: Lin, Zheng, et al.
Pubblicazione: (2024)
di: Lin, Zheng, et al.
Pubblicazione: (2024)
Proving Highly-Concurrent Traversals Correct
di: Feldman, Yotam M. Y., et al.
Pubblicazione: (2020)
di: Feldman, Yotam M. Y., et al.
Pubblicazione: (2020)
Epoch-based Optimistic Concurrency Control in Geo-replicated Databases
di: Mao, Yunhao, et al.
Pubblicazione: (2026)
di: Mao, Yunhao, et al.
Pubblicazione: (2026)
Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference
di: Wang, Qipeng
Pubblicazione: (2026)
di: Wang, Qipeng
Pubblicazione: (2026)
Advancing Hybrid Defense for Byzantine Attacks in Federated Learning
di: Yue, Kai, et al.
Pubblicazione: (2024)
di: Yue, Kai, et al.
Pubblicazione: (2024)
Resolving Conflicts with Grace: Dynamically Concurrent Universality
di: Kuznetsov, Petr, et al.
Pubblicazione: (2025)
di: Kuznetsov, Petr, et al.
Pubblicazione: (2025)
A Study of Synchronization Methods for Concurrent Size
di: Kas-Sharir, Hen, et al.
Pubblicazione: (2025)
di: Kas-Sharir, Hen, et al.
Pubblicazione: (2025)
Intelligent Router for LLM Workloads: Improving Performance Through Workload-Aware Load Balancing
di: Jain, Kunal, et al.
Pubblicazione: (2024)
di: Jain, Kunal, et al.
Pubblicazione: (2024)
Efficient Routing of Inference Requests across LLM Instances in Cloud-Edge Computing
di: Yu, Shibo, et al.
Pubblicazione: (2025)
di: Yu, Shibo, et al.
Pubblicazione: (2025)
Maintaining a Bounded Degree Expander in Dynamic Peer-to-Peer Networks
di: Cruciani, Antonio
Pubblicazione: (2025)
di: Cruciani, Antonio
Pubblicazione: (2025)
Anthemius: Efficient & Modular Block Assembly for Concurrent Execution
di: Neiheiser, Ray, et al.
Pubblicazione: (2025)
di: Neiheiser, Ray, et al.
Pubblicazione: (2025)
CONCUR: High-Throughput Agentic Batch Inference of LLM via Congestion-Based Concurrency Control
di: Chen, Qiaoling, et al.
Pubblicazione: (2026)
di: Chen, Qiaoling, et al.
Pubblicazione: (2026)
HPX -- An open source C++ Standard Library for Parallelism and Concurrency
di: Heller, Thomas, et al.
Pubblicazione: (2023)
di: Heller, Thomas, et al.
Pubblicazione: (2023)
Fulcrum: Optimizing Concurrent DNN Training and Inferencing on Edge Accelerators
di: K., Prashanthi S., et al.
Pubblicazione: (2025)
di: K., Prashanthi S., et al.
Pubblicazione: (2025)
SmartPQ: An Adaptive Concurrent Priority Queue for NUMA Architectures
di: Giannoula, Christina, et al.
Pubblicazione: (2024)
di: Giannoula, Christina, et al.
Pubblicazione: (2024)
SHRINK: Data Compression by Semantic Extraction and Residuals Encoding
di: Sun, Guoyou, et al.
Pubblicazione: (2024)
di: Sun, Guoyou, et al.
Pubblicazione: (2024)
INDIGO: Page Migration for Hardware Memory Disaggregation Across a Network
di: Patke, Archit, et al.
Pubblicazione: (2025)
di: Patke, Archit, et al.
Pubblicazione: (2025)
Why does Prediction Accuracy Decrease over Time? Uncertain Positive Learning for Cloud Failure Prediction
di: Li, Haozhe, et al.
Pubblicazione: (2024)
di: Li, Haozhe, et al.
Pubblicazione: (2024)
Gradient Compression and Correlation Driven Federated Learning for Wireless Traffic Prediction
di: Zhang, Chuanting, et al.
Pubblicazione: (2025)
di: Zhang, Chuanting, et al.
Pubblicazione: (2025)
AMECOS: A Modular Event-based Framework for Concurrent Object Specification
di: Albouy, Timothé, et al.
Pubblicazione: (2024)
di: Albouy, Timothé, et al.
Pubblicazione: (2024)
Tally: Non-Intrusive Performance Isolation for Concurrent Deep Learning Workloads
di: Zhao, Wei, et al.
Pubblicazione: (2024)
di: Zhao, Wei, et al.
Pubblicazione: (2024)
Concurrent Scheduling of High-Level Parallel Programs on Multi-GPU Systems
di: Knorr, Fabian, et al.
Pubblicazione: (2025)
di: Knorr, Fabian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
UFO3: Weaving the Digital Agent Galaxy
di: Zhang, Chaoyun, et al.
Pubblicazione: (2025) -
An Empirical Study of Production Incidents in Generative AI Cloud Services
di: Yan, Haoran, et al.
Pubblicazione: (2025) -
An Advanced Reinforcement Learning Framework for Online Scheduling of Deferrable Workloads in Cloud Computing
di: Dong, Hang, et al.
Pubblicazione: (2024) -
Deoxys: A Causal Inference Engine for Unhealthy Node Mitigation in Large-scale Cloud Infrastructure
di: Zhang, Chaoyun, et al.
Pubblicazione: (2024) -
The Vision of Autonomic Computing: Can LLMs Make It a Reality?
di: Zhang, Zhiyang, et al.
Pubblicazione: (2024)