A Method for Building Large Language Models with Predefined KV Cache Capacity
Fuente:
arXiv
Guardado en:
| Autores principales: | Yi, Zhonghua, Niu, Ge, Wang, Lei, Tang, Wei, Zhang, Liqiu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
dKV-Cache: The Cache for Diffusion Language Models
por: Ma, Xinyin, et al.
Publicado: (2025)
por: Ma, Xinyin, et al.
Publicado: (2025)
KVLink: Accelerating Large Language Models via Efficient KV Cache Reuse
por: Yang, Jingbo, et al.
Publicado: (2025)
por: Yang, Jingbo, et al.
Publicado: (2025)
SpindleKV: A Novel KV Cache Reduction Method Balancing Both Shallow and Deep Layers
por: Tang, Zicong, et al.
Publicado: (2025)
por: Tang, Zicong, et al.
Publicado: (2025)
RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction
por: Liu, Sihao, et al.
Publicado: (2026)
por: Liu, Sihao, et al.
Publicado: (2026)
Layer-Condensed KV Cache for Efficient Inference of Large Language Models
por: Wu, Haoyi, et al.
Publicado: (2024)
por: Wu, Haoyi, et al.
Publicado: (2024)
$A^3$: Attention-Aware Accurate KV Cache Fusion for Fast Large Language Model Serving
por: Zhou, Yuechi, et al.
Publicado: (2025)
por: Zhou, Yuechi, et al.
Publicado: (2025)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
por: Liu, Akide, et al.
Publicado: (2024)
por: Liu, Akide, et al.
Publicado: (2024)
AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models
por: Gu, Yifeng, et al.
Publicado: (2025)
por: Gu, Yifeng, et al.
Publicado: (2025)
AnTKV: Anchor Token-Aware Sub-Bit Vector Quantization for KV Cache in Large Language Models
por: Li, Zeyu, et al.
Publicado: (2025)
por: Li, Zeyu, et al.
Publicado: (2025)
Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs
por: Ge, Suyu, et al.
Publicado: (2023)
por: Ge, Suyu, et al.
Publicado: (2023)
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
por: Li, Kunxi, et al.
Publicado: (2025)
por: Li, Kunxi, et al.
Publicado: (2025)
CaliDrop: KV Cache Compression with Calibration
por: Su, Yi, et al.
Publicado: (2025)
por: Su, Yi, et al.
Publicado: (2025)
FlowMM: Cross-Modal Information Flow Guided KV Cache Merging for Efficient Multimodal Context Inference
por: Li, Kunxi, et al.
Publicado: (2025)
por: Li, Kunxi, et al.
Publicado: (2025)
EntropyCache: Decoded Token Entropy Guided KV Caching for Diffusion Language Models
por: Cheong, Minsoo, et al.
Publicado: (2026)
por: Cheong, Minsoo, et al.
Publicado: (2026)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
por: Shi, Dachuan, et al.
Publicado: (2025)
por: Shi, Dachuan, et al.
Publicado: (2025)
WeightedKV: Attention Scores Weighted Key-Value Cache Merging for Large Language Models
por: Yuan, Jian, et al.
Publicado: (2025)
por: Yuan, Jian, et al.
Publicado: (2025)
Accurate KV Cache Quantization with Outlier Tokens Tracing
por: Su, Yi, et al.
Publicado: (2025)
por: Su, Yi, et al.
Publicado: (2025)
QAQ: Quality Adaptive Quantization for LLM KV Cache
por: Dong, Shichen, et al.
Publicado: (2024)
por: Dong, Shichen, et al.
Publicado: (2024)
DynaSaur: Large Language Agents Beyond Predefined Actions
por: Nguyen, Dang, et al.
Publicado: (2024)
por: Nguyen, Dang, et al.
Publicado: (2024)
LongFlow: Efficient KV Cache Compression for Reasoning Models
por: Su, Yi, et al.
Publicado: (2026)
por: Su, Yi, et al.
Publicado: (2026)
TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization
por: Yao, Dingyu, et al.
Publicado: (2025)
por: Yao, Dingyu, et al.
Publicado: (2025)
AKVQ-VL: Attention-Aware KV Cache Adaptive 2-Bit Quantization for Vision-Language Models
por: Su, Zunhai, et al.
Publicado: (2025)
por: Su, Zunhai, et al.
Publicado: (2025)
Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption
por: Shi, Luohe, et al.
Publicado: (2024)
por: Shi, Luohe, et al.
Publicado: (2024)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
por: Cai, Zefan, et al.
Publicado: (2025)
por: Cai, Zefan, et al.
Publicado: (2025)
Crystal-KV: Efficient KV Cache Management for Chain-of-Thought LLMs via Answer-First Principle
por: Wang, Zihan, et al.
Publicado: (2026)
por: Wang, Zihan, et al.
Publicado: (2026)
SCBench: A KV Cache-Centric Analysis of Long-Context Methods
por: Li, Yucheng, et al.
Publicado: (2024)
por: Li, Yucheng, et al.
Publicado: (2024)
When Hidden States Drift: Can KV Caches Rescue Long-Range Speculative Decoding?
por: Liu, Tianyu, et al.
Publicado: (2026)
por: Liu, Tianyu, et al.
Publicado: (2026)
InnerQ: Hardware-Aware Tuning-Free Quantization of KV Cache for Large Language Models
por: Hosseini, Sayed Mohammadreza Tayaranian, et al.
Publicado: (2026)
por: Hosseini, Sayed Mohammadreza Tayaranian, et al.
Publicado: (2026)
G-KV: Decoding-Time KV Cache Eviction with Global Attention
por: Liao, Mengqi, et al.
Publicado: (2025)
por: Liao, Mengqi, et al.
Publicado: (2025)
WindowKV: Task-Adaptive Group-Wise KV Cache Window Selection for Efficient LLM Inference
por: Zuo, Youhui, et al.
Publicado: (2025)
por: Zuo, Youhui, et al.
Publicado: (2025)
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
por: Zhou, Xiabin, et al.
Publicado: (2024)
por: Zhou, Xiabin, et al.
Publicado: (2024)
XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference
por: Li, Weizhuo, et al.
Publicado: (2024)
por: Li, Weizhuo, et al.
Publicado: (2024)
EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction
por: Ji, Shiyu, et al.
Publicado: (2026)
por: Ji, Shiyu, et al.
Publicado: (2026)
Efficient Long-Context LLM Inference via KV Cache Clustering
por: Hu, Jie, et al.
Publicado: (2025)
por: Hu, Jie, et al.
Publicado: (2025)
ZigZagkv: Dynamic KV Cache Compression for Long-context Modeling based on Layer Uncertainty
por: Zhong, Meizhi, et al.
Publicado: (2024)
por: Zhong, Meizhi, et al.
Publicado: (2024)
ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing
por: An, Yongqi, et al.
Publicado: (2026)
por: An, Yongqi, et al.
Publicado: (2026)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
por: Liu, Xiang, et al.
Publicado: (2025)
por: Liu, Xiang, et al.
Publicado: (2025)
GraphKV: Breaking the Static Selection Paradigm with Graph-Based KV Cache Eviction
por: Li, Xuelin, et al.
Publicado: (2025)
por: Li, Xuelin, et al.
Publicado: (2025)
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
por: Chen, Hong, et al.
Publicado: (2026)
por: Chen, Hong, et al.
Publicado: (2026)
DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
por: Hao, Jitai, et al.
Publicado: (2026)
por: Hao, Jitai, et al.
Publicado: (2026)
Ejemplares similares
-
dKV-Cache: The Cache for Diffusion Language Models
por: Ma, Xinyin, et al.
Publicado: (2025) -
KVLink: Accelerating Large Language Models via Efficient KV Cache Reuse
por: Yang, Jingbo, et al.
Publicado: (2025) -
SpindleKV: A Novel KV Cache Reduction Method Balancing Both Shallow and Deep Layers
por: Tang, Zicong, et al.
Publicado: (2025) -
RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction
por: Liu, Sihao, et al.
Publicado: (2026) -
Layer-Condensed KV Cache for Efficient Inference of Large Language Models
por: Wu, Haoyi, et al.
Publicado: (2024)