MPIC: Position-Independent Multimodal Context Caching System for Efficient MLLM Serving
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Shiju, Hu, Junhao, Huang, Rongxiao, Zheng, Jiaqi, Chen, Guihai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
You Need an Encoder for Native Position-Independent Caching
di: Zhao, Shiju, et al.
Pubblicazione: (2026)
di: Zhao, Shiju, et al.
Pubblicazione: (2026)
EPIC: Efficient Position-Independent Caching for Serving Large Language Models
di: Hu, Junhao, et al.
Pubblicazione: (2024)
di: Hu, Junhao, et al.
Pubblicazione: (2024)
MEPIC: Memory Efficient Position Independent Caching for LLM Serving
di: Wang, Qian, et al.
Pubblicazione: (2025)
di: Wang, Qian, et al.
Pubblicazione: (2025)
Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving
di: Ma, Bole, et al.
Pubblicazione: (2026)
di: Ma, Bole, et al.
Pubblicazione: (2026)
Reinfier and Reintrainer: Verification and Interpretation-Driven Safe Deep Reinforcement Learning Frameworks
di: Yang, Zixuan, et al.
Pubblicazione: (2024)
di: Yang, Zixuan, et al.
Pubblicazione: (2024)
IC-Cache: Efficient Large Language Model Serving via In-context Caching
di: Yu, Yifan, et al.
Pubblicazione: (2025)
di: Yu, Yifan, et al.
Pubblicazione: (2025)
Efficient Serving for Dynamic Agent Workflows with Prediction-based KV-Cache Management
di: Zheng, Haoyu, et al.
Pubblicazione: (2026)
di: Zheng, Haoyu, et al.
Pubblicazione: (2026)
MTServe: Efficient Serving for Generative Recommendation Models with Hierarchical Caches
di: Wang, Xin, et al.
Pubblicazione: (2026)
di: Wang, Xin, et al.
Pubblicazione: (2026)
KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs
di: Chen, Chuangtao, et al.
Pubblicazione: (2026)
di: Chen, Chuangtao, et al.
Pubblicazione: (2026)
Apt-Serve: Adaptive Request Scheduling on Hybrid Cache for Scalable LLM Inference Serving
di: Gao, Shihong, et al.
Pubblicazione: (2025)
di: Gao, Shihong, et al.
Pubblicazione: (2025)
Rethinking Caching for LLM Serving Systems: Beyond Traditional Heuristics
di: Kim, Jungwoo, et al.
Pubblicazione: (2025)
di: Kim, Jungwoo, et al.
Pubblicazione: (2025)
EVICPRESS: Joint KV-Cache Compression and Eviction for Efficient LLM Serving
di: Feng, Shaoting, et al.
Pubblicazione: (2025)
di: Feng, Shaoting, et al.
Pubblicazione: (2025)
Decision Focused Causal Learning for Direct Counterfactual Marketing Optimization
di: Zhou, Hao, et al.
Pubblicazione: (2024)
di: Zhou, Hao, et al.
Pubblicazione: (2024)
Lethe: Layer- and Time-Adaptive KV Cache Pruning for Reasoning-Intensive LLM Serving
di: Zeng, Hui, et al.
Pubblicazione: (2025)
di: Zeng, Hui, et al.
Pubblicazione: (2025)
Beyond Anti-Forgetting: Multimodal Continual Instruction Tuning with Positive Forward Transfer
di: Zheng, Junhao, et al.
Pubblicazione: (2024)
di: Zheng, Junhao, et al.
Pubblicazione: (2024)
DGHMesh: A Large-scale Dual-radar mmWave Dataset and Generalization-focused Benchmark for Human Mesh Reconstruction
di: Guo, Rongxiao, et al.
Pubblicazione: (2026)
di: Guo, Rongxiao, et al.
Pubblicazione: (2026)
ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing
di: Chen, Kaiwen, et al.
Pubblicazione: (2025)
di: Chen, Kaiwen, et al.
Pubblicazione: (2025)
CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion
di: Yao, Jiayi, et al.
Pubblicazione: (2024)
di: Yao, Jiayi, et al.
Pubblicazione: (2024)
Revisiting Service Level Objectives and System Level Metrics in Large Language Model Serving
di: Wang, Zhibin, et al.
Pubblicazione: (2024)
di: Wang, Zhibin, et al.
Pubblicazione: (2024)
Continuous Semantic Caching for Low-Cost LLM Serving
di: Atalar, Baran, et al.
Pubblicazione: (2026)
di: Atalar, Baran, et al.
Pubblicazione: (2026)
CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving
di: Liu, Yuhan, et al.
Pubblicazione: (2023)
di: Liu, Yuhan, et al.
Pubblicazione: (2023)
Oaken: Fast and Efficient LLM Serving with Online-Offline Hybrid KV Cache Quantization
di: Kim, Minsu, et al.
Pubblicazione: (2025)
di: Kim, Minsu, et al.
Pubblicazione: (2025)
Cost-Efficient Large Language Model Serving for Multi-turn Conversations with CachedAttention
di: Gao, Bin, et al.
Pubblicazione: (2024)
di: Gao, Bin, et al.
Pubblicazione: (2024)
TokenFlow: Responsive LLM Text Streaming Serving under Request Burst via Preemptive Scheduling
di: Chen, Junyi, et al.
Pubblicazione: (2025)
di: Chen, Junyi, et al.
Pubblicazione: (2025)
Bi-Level Decision-Focused Causal Learning for Large-Scale Marketing Optimization: Bridging Observational and Experimental Data
di: Zhang, Shuli, et al.
Pubblicazione: (2025)
di: Zhang, Shuli, et al.
Pubblicazione: (2025)
The CAP Principle for LLM Serving: A Survey of Long-Context Large Language Model Serving
di: Zeng, Pai, et al.
Pubblicazione: (2024)
di: Zeng, Pai, et al.
Pubblicazione: (2024)
Atom: Low-bit Quantization for Efficient and Accurate LLM Serving
di: Zhao, Yilong, et al.
Pubblicazione: (2023)
di: Zhao, Yilong, et al.
Pubblicazione: (2023)
Cost-Efficient LLM Serving in the Cloud: VM Selection with KV Cache Offloading
di: Kim, Kihyun, et al.
Pubblicazione: (2025)
di: Kim, Kihyun, et al.
Pubblicazione: (2025)
ShadowServe: Interference-Free KV Cache Fetching for Distributed Prefix Caching
di: Xiang, Xingyu, et al.
Pubblicazione: (2025)
di: Xiang, Xingyu, et al.
Pubblicazione: (2025)
Sparse Prefix Caching for Hybrid and Recurrent LLM Serving
di: Shirokikh, Mikhail, et al.
Pubblicazione: (2026)
di: Shirokikh, Mikhail, et al.
Pubblicazione: (2026)
MorphServe: Efficient and Workload-Aware LLM Serving via Runtime Quantized Layer Swapping and KV Cache Resizing
di: Su, Zhaoyuan, et al.
Pubblicazione: (2025)
di: Su, Zhaoyuan, et al.
Pubblicazione: (2025)
Scaling Graph Chain-of-Thought Reasoning: A Multi-Agent Framework with Efficient LLM Serving
di: Huan, Chengying, et al.
Pubblicazione: (2025)
di: Huan, Chengying, et al.
Pubblicazione: (2025)
ChemMLLM: Chemical Multimodal Large Language Model
di: Tan, Qian, et al.
Pubblicazione: (2025)
di: Tan, Qian, et al.
Pubblicazione: (2025)
Semantic Caching for Low-Cost LLM Serving: From Offline Learning to Online Adaptation
di: Liu, Xutong, et al.
Pubblicazione: (2025)
di: Liu, Xutong, et al.
Pubblicazione: (2025)
iServe: An Intent-based Serving System for LLMs
di: Liakopoulos, Dimitrios, et al.
Pubblicazione: (2025)
di: Liakopoulos, Dimitrios, et al.
Pubblicazione: (2025)
TokenLake: A Unified Segment-level Prefix Cache Pool for Fine-grained Elastic Long-Context LLM Serving
di: Wu, Bingyang, et al.
Pubblicazione: (2025)
di: Wu, Bingyang, et al.
Pubblicazione: (2025)
SAW-INT4: System-Aware 4-Bit KV-Cache Quantization for Real-World LLM Serving
di: Jia, Jinda, et al.
Pubblicazione: (2026)
di: Jia, Jinda, et al.
Pubblicazione: (2026)
Bit-Flip Vulnerability of Shared KV-Cache Blocks in LLM Serving Systems
di: Yamamoto, Yuji, et al.
Pubblicazione: (2026)
di: Yamamoto, Yuji, et al.
Pubblicazione: (2026)
Graph-MLLM: Harnessing Multimodal Large Language Models for Multimodal Graph Learning
di: Liu, Jiajin, et al.
Pubblicazione: (2025)
di: Liu, Jiajin, et al.
Pubblicazione: (2025)
Joint Encoding of KV-Cache Blocks for Scalable LLM Serving
di: Kampeas, Joseph, et al.
Pubblicazione: (2026)
di: Kampeas, Joseph, et al.
Pubblicazione: (2026)
Documenti analoghi
-
You Need an Encoder for Native Position-Independent Caching
di: Zhao, Shiju, et al.
Pubblicazione: (2026) -
EPIC: Efficient Position-Independent Caching for Serving Large Language Models
di: Hu, Junhao, et al.
Pubblicazione: (2024) -
MEPIC: Memory Efficient Position Independent Caching for LLM Serving
di: Wang, Qian, et al.
Pubblicazione: (2025) -
Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving
di: Ma, Bole, et al.
Pubblicazione: (2026) -
Reinfier and Reintrainer: Verification and Interpretation-Driven Safe Deep Reinforcement Learning Frameworks
di: Yang, Zixuan, et al.
Pubblicazione: (2024)