Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries
Fuente:
arXiv
Guardado en:
| Autores principales: | Kim, Junhyuck, Park, Jongho, Cho, Jaewoong, Papailiopoulos, Dimitris |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Not All Bits Are Equal: Scale-Dependent Memory Optimization Strategies for Reasoning Models
por: Kim, Junhyuck, et al.
Publicado: (2025)
por: Kim, Junhyuck, et al.
Publicado: (2025)
Can Mamba Learn How to Learn? A Comparative Study on In-Context Learning Tasks
por: Park, Jongho, et al.
Publicado: (2024)
por: Park, Jongho, et al.
Publicado: (2024)
Beyond RLHF: A Unified Theoretical Framework of Alignment
por: Yun, Jihun, et al.
Publicado: (2025)
por: Yun, Jihun, et al.
Publicado: (2025)
Predictive Pipelined Decoding: A Compute-Latency Trade-off for Exact LLM Decoding
por: Yang, Seongjun, et al.
Publicado: (2023)
por: Yang, Seongjun, et al.
Publicado: (2023)
Pruning and Distilling Mixture-of-Experts into Dense Language Models
por: Kim, Junhyuck, et al.
Publicado: (2026)
por: Kim, Junhyuck, et al.
Publicado: (2026)
HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs
por: Yang, Dongquan, et al.
Publicado: (2025)
por: Yang, Dongquan, et al.
Publicado: (2025)
The Pitfalls of KV Cache Compression
por: Chen, Alex, et al.
Publicado: (2025)
por: Chen, Alex, et al.
Publicado: (2025)
Training Transformers for KV Cache Compressibility
por: Gelberg, Yoav, et al.
Publicado: (2026)
por: Gelberg, Yoav, et al.
Publicado: (2026)
FibQuant: Universal Vector Quantization for Random-Access KV-Cache Compression
por: Lee, Namyoon, et al.
Publicado: (2026)
por: Lee, Namyoon, et al.
Publicado: (2026)
FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding Acceleration
por: Jo, Dongwon, et al.
Publicado: (2025)
por: Jo, Dongwon, et al.
Publicado: (2025)
KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction
por: Kim, Jang-Hyun, et al.
Publicado: (2025)
por: Kim, Jang-Hyun, et al.
Publicado: (2025)
KV-CAR: KV Cache Compression using Autoencoders and KV Reuse in Large Language Models
por: Roy, Sourjya, et al.
Publicado: (2025)
por: Roy, Sourjya, et al.
Publicado: (2025)
KaVa: Latent Reasoning via Compressed KV-Cache Distillation
por: Kuzina, Anna, et al.
Publicado: (2025)
por: Kuzina, Anna, et al.
Publicado: (2025)
ThinKV: Thought-Adaptive KV Cache Compression for Efficient Reasoning Models
por: Ramachandran, Akshat, et al.
Publicado: (2025)
por: Ramachandran, Akshat, et al.
Publicado: (2025)
InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management
por: Lee, Wonbeom, et al.
Publicado: (2024)
por: Lee, Wonbeom, et al.
Publicado: (2024)
No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization
por: Yang, June Yong, et al.
Publicado: (2024)
por: Yang, June Yong, et al.
Publicado: (2024)
KVSculpt: KV Cache Compression as Distillation
por: Jiang, Bo, et al.
Publicado: (2026)
por: Jiang, Bo, et al.
Publicado: (2026)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
por: Wang, Yixuan, et al.
Publicado: (2025)
por: Wang, Yixuan, et al.
Publicado: (2025)
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
por: Chang, Chi-Chih, et al.
Publicado: (2025)
por: Chang, Chi-Chih, et al.
Publicado: (2025)
SWAN: Sparse Winnowed Attention for Reduced Inference Memory via Decompression-Free KV-Cache Compression
por: S, Santhosh G, et al.
Publicado: (2025)
por: S, Santhosh G, et al.
Publicado: (2025)
ManifoldKV: Training-Free KV Cache Compression via Euclidean Outlier Detection
por: Datta, Debajyoti, et al.
Publicado: (2026)
por: Datta, Debajyoti, et al.
Publicado: (2026)
RAP: KV-Cache Compression via RoPE-Aligned Pruning
por: Xin, Jihao, et al.
Publicado: (2026)
por: Xin, Jihao, et al.
Publicado: (2026)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
por: Yu, Bohan, et al.
Publicado: (2025)
por: Yu, Bohan, et al.
Publicado: (2025)
KVCompose: Efficient Structured KV Cache Compression with Composite Tokens
por: Akulov, Dmitry, et al.
Publicado: (2025)
por: Akulov, Dmitry, et al.
Publicado: (2025)
TriAxialKV: Toward Extreme Low-Precision KV-Cache Quantization for Agentic Inference Tasks
por: Shen, Hanzhang, et al.
Publicado: (2026)
por: Shen, Hanzhang, et al.
Publicado: (2026)
ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration
por: Yan, Xianglong, et al.
Publicado: (2025)
por: Yan, Xianglong, et al.
Publicado: (2025)
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
por: Behnam, Payman, et al.
Publicado: (2025)
por: Behnam, Payman, et al.
Publicado: (2025)
Sparse Attention across Multiple-context KV Cache
por: Cao, Ziyi, et al.
Publicado: (2025)
por: Cao, Ziyi, et al.
Publicado: (2025)
KV Pareto: Systems-Level Optimization of KV Cache and Model Compression for Long Context Inference
por: Gokhale, Sai, et al.
Publicado: (2025)
por: Gokhale, Sai, et al.
Publicado: (2025)
Palu: Compressing KV-Cache with Low-Rank Projection
por: Chang, Chi-Chih, et al.
Publicado: (2024)
por: Chang, Chi-Chih, et al.
Publicado: (2024)
Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression
por: Swain, Kabir, et al.
Publicado: (2026)
por: Swain, Kabir, et al.
Publicado: (2026)
Inference-Time Hyper-Scaling with KV Cache Compression
por: Łańcucki, Adrian, et al.
Publicado: (2025)
por: Łańcucki, Adrian, et al.
Publicado: (2025)
ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression
por: Liu, Guangda, et al.
Publicado: (2024)
por: Liu, Guangda, et al.
Publicado: (2024)
A Simple Plug-in for Improving Eviction-Based KV Cache Compression
por: Lin, Yuping, et al.
Publicado: (2026)
por: Lin, Yuping, et al.
Publicado: (2026)
KQ-SVD: Compressing the KV Cache with Provable Guarantees on Attention Fidelity
por: Lesens, Damien, et al.
Publicado: (2025)
por: Lesens, Damien, et al.
Publicado: (2025)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
por: Zhu, Yuxuan, et al.
Publicado: (2025)
por: Zhu, Yuxuan, et al.
Publicado: (2025)
LongFlow: Efficient KV Cache Compression for Reasoning Models
por: Su, Yi, et al.
Publicado: (2026)
por: Su, Yi, et al.
Publicado: (2026)
AttentionPredictor: Temporal Patterns Matter for KV Cache Compression
por: Yang, Qingyue, et al.
Publicado: (2025)
por: Yang, Qingyue, et al.
Publicado: (2025)
Quantization Dominates Rank Reduction for KV-Cache Compression
por: Salfati, Samuel
Publicado: (2026)
por: Salfati, Samuel
Publicado: (2026)
SmallKV: Small Model Assisted Compensation of KV Cache Compression for Efficient LLM Inference
por: Zhao, Yi, et al.
Publicado: (2025)
por: Zhao, Yi, et al.
Publicado: (2025)
Ejemplares similares
-
Not All Bits Are Equal: Scale-Dependent Memory Optimization Strategies for Reasoning Models
por: Kim, Junhyuck, et al.
Publicado: (2025) -
Can Mamba Learn How to Learn? A Comparative Study on In-Context Learning Tasks
por: Park, Jongho, et al.
Publicado: (2024) -
Beyond RLHF: A Unified Theoretical Framework of Alignment
por: Yun, Jihun, et al.
Publicado: (2025) -
Predictive Pipelined Decoding: A Compute-Latency Trade-off for Exact LLM Decoding
por: Yang, Seongjun, et al.
Publicado: (2023) -
Pruning and Distilling Mixture-of-Experts into Dense Language Models
por: Kim, Junhyuck, et al.
Publicado: (2026)