Beluga: A CXL-Based Memory Architecture for Scalable and Efficient LLM KVCache Management
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Xinjun, Hu, Qingda, Li, Junru, Li, Feifei, Zhu, Yicong, Zhou, Yuqi, Lin, Qiuru, Dai, Jian, Kong, Yang, Zhang, Jiayu, Xu, Guoqiang, Liu, Qiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PolarStore: High-Performance Data Compression for Large-Scale Cloud-Native Databases
par: Hu, Qingda, et autres
Publié: (2025)
par: Hu, Qingda, et autres
Publié: (2025)
CXL Shared Memory Programming: Barely Distributed and Almost Persistent
par: Xu, Yi, et autres
Publié: (2024)
par: Xu, Yi, et autres
Publié: (2024)
Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter
par: Qin, Ruoyu, et autres
Publié: (2026)
par: Qin, Ruoyu, et autres
Publié: (2026)
Self-Evolving Distributed Memory Architecture for Scalable AI Systems
par: Li, Zixuan, et autres
Publié: (2026)
par: Li, Zixuan, et autres
Publié: (2026)
KVCache Cache in the Wild: Characterizing and Optimizing KVCache Cache at a Large Cloud Provider
par: Wang, Jiahao, et autres
Publié: (2025)
par: Wang, Jiahao, et autres
Publié: (2025)
Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving
par: Qin, Ruoyu, et autres
Publié: (2024)
par: Qin, Ruoyu, et autres
Publié: (2024)
HybridTier: an Adaptive and Lightweight CXL-Memory Tiering System
par: Song, Kevin, et autres
Publié: (2023)
par: Song, Kevin, et autres
Publié: (2023)
Analysis and Optimized CXL-Attached Memory Allocation for Long-Context LLM Fine-Tuning
par: Liaw, Yong-Cheng, et autres
Publié: (2025)
par: Liaw, Yong-Cheng, et autres
Publié: (2025)
CCCL: Node-Spanning GPU Collectives with CXL Memory Pooling
par: Xu, Dong, et autres
Publié: (2026)
par: Xu, Dong, et autres
Publié: (2026)
TraCT: Disaggregated LLM Serving with CXL Shared Memory KV Cache at Rack-Scale
par: Yoon, Dongha, et autres
Publié: (2025)
par: Yoon, Dongha, et autres
Publié: (2025)
Towards CXL Resilience to CPU Failures
par: Psistakis, Antonis, et autres
Publié: (2026)
par: Psistakis, Antonis, et autres
Publié: (2026)
A Programming Model for Disaggregated Memory over CXL
par: Assa, Gal, et autres
Publié: (2024)
par: Assa, Gal, et autres
Publié: (2024)
Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache
par: Lin, Bin, et autres
Publié: (2024)
par: Lin, Bin, et autres
Publié: (2024)
Telepathic Datacenters: Fast RPCs using Shared CXL Memory
par: Mahar, Suyash, et autres
Publié: (2024)
par: Mahar, Suyash, et autres
Publié: (2024)
Equilibria: Fair Multi-Tenant CXL Memory Tiering At Scale
par: Zhao, Kaiyang, et autres
Publié: (2026)
par: Zhao, Kaiyang, et autres
Publié: (2026)
Matrix representation and GPU-optimized parallel B-spline computing
par: Wu, Jiayu, et autres
Publié: (2025)
par: Wu, Jiayu, et autres
Publié: (2025)
Bridging Cache-Friendliness and Concurrency: A Locality-Optimized In-Memory B-Skiplist
par: Luo, Yicong, et autres
Publié: (2025)
par: Luo, Yicong, et autres
Publié: (2025)
Modeling the Potential of Message-Free Communication via CXL.mem
par: Vanecek, Stepan, et autres
Publié: (2025)
par: Vanecek, Stepan, et autres
Publié: (2025)
emucxl: an emulation framework for CXL-based disaggregated memory applications
par: Gond, Raja, et autres
Publié: (2024)
par: Gond, Raja, et autres
Publié: (2024)
Pooling Engram Conditional Memory in Large Language Models using CXL
par: Ma, Ruiyang, et autres
Publié: (2026)
par: Ma, Ruiyang, et autres
Publié: (2026)
MPI-over-CXL: Enhancing Communication Efficiency in Distributed HPC Systems
par: Kwon, Miryeong, et autres
Publié: (2025)
par: Kwon, Miryeong, et autres
Publié: (2025)
DRust: Language-Guided Distributed Shared Memory with Fine Granularity, Full Transparency, and Ultra Efficiency
par: Ma, Haoran, et autres
Publié: (2024)
par: Ma, Haoran, et autres
Publié: (2024)
DPC: A Distributed Page Cache over CXL
par: Bergman, Shai, et autres
Publié: (2026)
par: Bergman, Shai, et autres
Publié: (2026)
Hestia: Hyperthread-Level Scheduling for Cloud Microservices with Interference-Aware Attention
par: Yang, Dingyu, et autres
Publié: (2026)
par: Yang, Dingyu, et autres
Publié: (2026)
Automatic BLAS Offloading on Unified Memory Architecture: A Study on NVIDIA Grace-Hopper
par: Li, Junjie, et autres
Publié: (2024)
par: Li, Junjie, et autres
Publié: (2024)
FLARE: A Dataflow-Aware and Scalable Hardware Architecture for Neural-Hybrid Scientific Lossy Compression
par: Jia, Wenqi, et autres
Publié: (2025)
par: Jia, Wenqi, et autres
Publié: (2025)
ScalePool: Hybrid XLink-CXL Fabric for Composable Resource Disaggregation in Unified Scale-up Domains
par: Woo, Hyein, et autres
Publié: (2025)
par: Woo, Hyein, et autres
Publié: (2025)
Exploring and Evaluating Real-world CXL: Use Cases and System Adoption
par: Wang, Xi, et autres
Publié: (2024)
par: Wang, Xi, et autres
Publié: (2024)
Beluga: Block Synchronization for BFT Consensus Protocols
par: Kichidis, Tasos, et autres
Publié: (2025)
par: Kichidis, Tasos, et autres
Publié: (2025)
Jenga: Effective Memory Management for Serving LLM with Heterogeneity
par: Zhang, Chen, et autres
Publié: (2025)
par: Zhang, Chen, et autres
Publié: (2025)
ESS: An Offload-Centric Latent-Cache Management Architecture for DeepSeek-V3.2-Exp
par: Chen, Xinhang, et autres
Publié: (2025)
par: Chen, Xinhang, et autres
Publié: (2025)
SwitchDelta: Asynchronous Metadata Updating for Distributed Storage with In-Network Data Visibility
par: Li, Junru, et autres
Publié: (2025)
par: Li, Junru, et autres
Publié: (2025)
Scalable Distributed Vector Search via Accuracy Preserving Index Construction
par: Xu, Yuming, et autres
Publié: (2025)
par: Xu, Yuming, et autres
Publié: (2025)
Janus: Disaggregating Attention and Experts for Scalable MoE Inference
par: Zhang, Zhexiang, et autres
Publié: (2025)
par: Zhang, Zhexiang, et autres
Publié: (2025)
W4A16 Mixed-Precision Matrix Multiplication on Decoupled Architecture: Kernel Design and Memory Bottleneck Analysis for Ascend NPUs
par: He, Yuanhong, et autres
Publié: (2026)
par: He, Yuanhong, et autres
Publié: (2026)
On the Performance and Memory Footprint of Distributed Training: An Empirical Study on Transformers
par: Lu, Zhengxian, et autres
Publié: (2024)
par: Lu, Zhengxian, et autres
Publié: (2024)
Efficient Graph Embedding at Scale: Optimizing CPU-GPU-SSD Integration
par: Li, Zhonggen, et autres
Publié: (2025)
par: Li, Zhonggen, et autres
Publié: (2025)
Memory-aware Adaptive Scheduling of Scientific Workflows on Heterogeneous Architectures
par: Kulagina, Svetlana, et autres
Publié: (2025)
par: Kulagina, Svetlana, et autres
Publié: (2025)
Scalable HPC Job Scheduling and Resource Management in SST
par: Abdurahman, Abubeker, et autres
Publié: (2025)
par: Abdurahman, Abubeker, et autres
Publié: (2025)
Parallel Data Object Creation: Towards Scalable Metadata Management in High-Performance I/O Library
par: Li, Youjia, et autres
Publié: (2025)
par: Li, Youjia, et autres
Publié: (2025)
Documents similaires
-
PolarStore: High-Performance Data Compression for Large-Scale Cloud-Native Databases
par: Hu, Qingda, et autres
Publié: (2025) -
CXL Shared Memory Programming: Barely Distributed and Almost Persistent
par: Xu, Yi, et autres
Publié: (2024) -
Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter
par: Qin, Ruoyu, et autres
Publié: (2026) -
Self-Evolving Distributed Memory Architecture for Scalable AI Systems
par: Li, Zixuan, et autres
Publié: (2026) -
KVCache Cache in the Wild: Characterizing and Optimizing KVCache Cache at a Large Cloud Provider
par: Wang, Jiahao, et autres
Publié: (2025)