BaKlaVa -- Budgeted Allocation of KV cache for Long-context Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gulhan, Ahmed Burak, Chitty-Venkata, Krishna Teja, Emani, Murali, Kandemir, Mahmut, Vishwanath, Venkatram |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LangVision-LoRA-NAS: Neural Architecture Search for Variable LoRA Rank in Vision Language Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
LExI: Layer-Adaptive Active Experts for Efficient MoE Model Inference
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
PreLoRA: Hybrid Pre-training of Vision Transformers with Full Training and Low-Rank Adapters
par: Thapa, Krishu K, et autres
Publié: (2025)
par: Thapa, Krishu K, et autres
Publié: (2025)
Swimba: Switch Mamba Model Scales State Space Models
par: Du, Zhixu, et autres
Publié: (2026)
par: Du, Zhixu, et autres
Publié: (2026)
MoPEQ: Mixture of Mixed Precision Quantized Experts
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
LLM-Inference-Bench: Inference Benchmarking of Large Language Models on AI Accelerators
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2024)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2024)
AsymVLM: Asymmetric Token Pruning for Efficient Vision-Language Model Inference
par: Feng, Yilin, et autres
Publié: (2026)
par: Feng, Yilin, et autres
Publié: (2026)
Parallel Context Compaction for Long-Horizon LLM Agent Serving
par: Cim, Musa, et autres
Publié: (2026)
par: Cim, Musa, et autres
Publié: (2026)
Diagnosing FP4 inference: a layer-wise and block-wise sensitivity analysis of NVFP4 and MXFP4
par: Cim, Musa, et autres
Publié: (2026)
par: Cim, Musa, et autres
Publié: (2026)
Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference
par: Feng, Yuan, et autres
Publié: (2024)
par: Feng, Yuan, et autres
Publié: (2024)
IceCache: Memory-efficient KV-cache Management for Long-Sequence LLMs
par: Mao, Yuzhen, et autres
Publié: (2026)
par: Mao, Yuzhen, et autres
Publié: (2026)
Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference
par: Luo, Zhifan, et autres
Publié: (2025)
par: Luo, Zhifan, et autres
Publié: (2025)
KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems
par: Ye, Hancheng, et autres
Publié: (2025)
par: Ye, Hancheng, et autres
Publié: (2025)
LAVa: Layer-wise KV Cache Eviction with Dynamic Budget Allocation
par: Shen, Yiqun, et autres
Publié: (2025)
par: Shen, Yiqun, et autres
Publié: (2025)
Accelerating Suffix Jailbreak attacks with Prefix-Shared KV-cache
par: Wang, Xinhai, et autres
Publié: (2026)
par: Wang, Xinhai, et autres
Publié: (2026)
Scalable and Adaptive Parallel Training of Graph Transformer on Large Graphs
par: Lin, Jun-Liang, et autres
Publié: (2026)
par: Lin, Jun-Liang, et autres
Publié: (2026)
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
par: Dehghanighobadi, Zahra, et autres
Publié: (2026)
par: Dehghanighobadi, Zahra, et autres
Publié: (2026)
ARKV: Adaptive and Resource-Efficient KV Cache Management under Limited Memory Budget for Long-Context Inference in LLMs
par: Lei, Jianlong, et autres
Publié: (2026)
par: Lei, Jianlong, et autres
Publié: (2026)
Efficient and Practical Black-Box Verification of Quantum Metric Learning Algorithms
par: Shokry, Ahmed, et autres
Publié: (2026)
par: Shokry, Ahmed, et autres
Publié: (2026)
KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference
par: Nadali, Alireza, et autres
Publié: (2026)
par: Nadali, Alireza, et autres
Publié: (2026)
Budgeted LoRA: Distillation as Structured Compute Allocation for Efficient Inference
par: Sabry, Mohammed, et autres
Publié: (2026)
par: Sabry, Mohammed, et autres
Publié: (2026)
An experimental study of KV cache reuse strategies in chunk-level caching systems
par: Cestola, Samuel, et autres
Publié: (2026)
par: Cestola, Samuel, et autres
Publié: (2026)
CoKV: Optimizing KV Cache Allocation via Cooperative Game
par: Sun, Qiheng, et autres
Publié: (2025)
par: Sun, Qiheng, et autres
Publié: (2025)
KVCrush: Key value cache size-reduction using similarity in head-behaviour
par: Jha, Gopi Krishna, et autres
Publié: (2025)
par: Jha, Gopi Krishna, et autres
Publié: (2025)
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
par: Li, Kunxi, et autres
Publié: (2025)
par: Li, Kunxi, et autres
Publié: (2025)
Reformulating KV Cache Eviction Problem for Long-Context LLM Inference
par: Mai, Tho, et autres
Publié: (2026)
par: Mai, Tho, et autres
Publié: (2026)
KV Admission: Learning What to Write for Efficient Long-Context Inference
par: Huang, Yen-Chieh, et autres
Publié: (2025)
par: Huang, Yen-Chieh, et autres
Publié: (2025)
Adaptive KV-Cache Compression without Manually Setting Budget
par: Tang, Chenxia, et autres
Publié: (2025)
par: Tang, Chenxia, et autres
Publié: (2025)
Inclusive Practices for Child-Centered AI Design and Testing
par: Dotch, Emani, et autres
Publié: (2024)
par: Dotch, Emani, et autres
Publié: (2024)
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
par: Dzikanyanga, Gradwell, et autres
Publié: (2026)
par: Dzikanyanga, Gradwell, et autres
Publié: (2026)
Listen to the Layers: Mitigating Hallucinations with Inter-Layer Disagreement
par: Subbalakshmi, Koduvayur, et autres
Publié: (2026)
par: Subbalakshmi, Koduvayur, et autres
Publié: (2026)
HeatKV: Head-tuned KV-cache Compression for Visual Autoregressive Modeling
par: Cederlund, Jonathan, et autres
Publié: (2026)
par: Cederlund, Jonathan, et autres
Publié: (2026)
Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference
par: Liu, Baihui, et autres
Publié: (2026)
par: Liu, Baihui, et autres
Publié: (2026)
KVSwap: Disk-aware KV Cache Offloading for Long-Context On-device Inference
par: Zhang, Huawei, et autres
Publié: (2025)
par: Zhang, Huawei, et autres
Publié: (2025)
Pretraining large language models with MXFP4 on Native FP4 Hardware
par: Cim, Musa, et autres
Publié: (2026)
par: Cim, Musa, et autres
Publié: (2026)
ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference
par: Li, Junjie, et autres
Publié: (2026)
par: Li, Junjie, et autres
Publié: (2026)
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
par: Gu, Yuzhe, et autres
Publié: (2025)
par: Gu, Yuzhe, et autres
Publié: (2025)
Documents similaires
-
LangVision-LoRA-NAS: Neural Architecture Search for Variable LoRA Rank in Vision Language Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025) -
LExI: Layer-Adaptive Active Experts for Efficient MoE Model Inference
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025) -
PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025) -
ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025) -
PreLoRA: Hybrid Pre-training of Vision Transformers with Full Training and Low-Rank Adapters
par: Thapa, Krishu K, et autres
Publié: (2025)