Palu: Compressing KV-Cache with Low-Rank Projection
Fuente:
arXiv
Salvato in:
| Autori principali: | Chang, Chi-Chih, Lin, Wei-Cheng, Lin, Chien-Yu, Chen, Chong-Yan, Hu, Yu-Fang, Wang, Pei-Shuo, Huang, Ning-Chi, Ceze, Luis, Abdelfattah, Mohamed S., Wu, Kai-Chiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
di: Chang, Chi-Chih, et al.
Pubblicazione: (2025)
di: Chang, Chi-Chih, et al.
Pubblicazione: (2025)
UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
FLRC: Fine-grained Low-Rank Compressor for Efficient LLM Inference
di: Lu, Yu-Chen, et al.
Pubblicazione: (2025)
di: Lu, Yu-Chen, et al.
Pubblicazione: (2025)
SkipCat: Rank-Maximized Low-Rank Compression of Large Language Models via Shared Projection and Block Skipping
di: Lu, Yu-Chen, et al.
Pubblicazione: (2025)
di: Lu, Yu-Chen, et al.
Pubblicazione: (2025)
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
di: Wang, Pei-Shuo, et al.
Pubblicazione: (2025)
di: Wang, Pei-Shuo, et al.
Pubblicazione: (2025)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
V"Mean"ba: Visual State Space Models only need 1 hidden dimension
di: Chi, Tien-Yu, et al.
Pubblicazione: (2024)
di: Chi, Tien-Yu, et al.
Pubblicazione: (2024)
Quamba2: A Robust and Scalable Post-training Quantization Framework for Selective State Space Models
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
EliteKV: Scalable KV Cache Compression via RoPE Frequency Selection and Joint Low-Rank Projection
di: Zhou, Yuhao, et al.
Pubblicazione: (2025)
di: Zhou, Yuhao, et al.
Pubblicazione: (2025)
SRT: Accelerating Reinforcement Learning via Speculative Rollout with Tree-Structured Cache
di: Chang, Chi-Chih, et al.
Pubblicazione: (2026)
di: Chang, Chi-Chih, et al.
Pubblicazione: (2026)
LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy
di: Zhang, Rongzhi, et al.
Pubblicazione: (2024)
di: Zhang, Rongzhi, et al.
Pubblicazione: (2024)
Eigen Attention: Attention in Low-Rank Space for KV Cache Compression
di: Saxena, Utkarsh, et al.
Pubblicazione: (2024)
di: Saxena, Utkarsh, et al.
Pubblicazione: (2024)
KV-CoRE: Benchmarking Data-Dependent Low-Rank Compressibility of KV-Caches in LLMs
di: Chen, Jian, et al.
Pubblicazione: (2026)
di: Chen, Jian, et al.
Pubblicazione: (2026)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
di: Yu, Bohan, et al.
Pubblicazione: (2025)
di: Yu, Bohan, et al.
Pubblicazione: (2025)
ELSA: Exploiting Layer-wise N:M Sparsity for Vision Transformer Acceleration
di: Huang, Ning-Chi, et al.
Pubblicazione: (2024)
di: Huang, Ning-Chi, et al.
Pubblicazione: (2024)
ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration
di: Yan, Xianglong, et al.
Pubblicazione: (2025)
di: Yan, Xianglong, et al.
Pubblicazione: (2025)
Quantization Dominates Rank Reduction for KV-Cache Compression
di: Salfati, Samuel
Pubblicazione: (2026)
di: Salfati, Samuel
Pubblicazione: (2026)
DARE: Diffusion Language Model Activation Reuse for Efficient Inference
di: Frumkin, Natalia, et al.
Pubblicazione: (2026)
di: Frumkin, Natalia, et al.
Pubblicazione: (2026)
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
di: Chen, Hong, et al.
Pubblicazione: (2026)
di: Chen, Hong, et al.
Pubblicazione: (2026)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
di: Cai, Zefan, et al.
Pubblicazione: (2025)
di: Cai, Zefan, et al.
Pubblicazione: (2025)
dKV-Cache: The Cache for Diffusion Language Models
di: Ma, Xinyin, et al.
Pubblicazione: (2025)
di: Ma, Xinyin, et al.
Pubblicazione: (2025)
Effects of Essential Oil Aromatherapy on Sleep, Depression, and Well‐Being Among Older Adults: Implications for Community Health and Social Care
di: Pei Fen Chiang, et al.
Pubblicazione: (2026)
di: Pei Fen Chiang, et al.
Pubblicazione: (2026)
The Pitfalls of KV Cache Compression
di: Chen, Alex, et al.
Pubblicazione: (2025)
di: Chen, Alex, et al.
Pubblicazione: (2025)
Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference
di: Dong, Harry, et al.
Pubblicazione: (2024)
di: Dong, Harry, et al.
Pubblicazione: (2024)
RazorAttention: Efficient KV Cache Compression Through Retrieval Heads
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
Head-Aware KV Cache Compression for Efficient Visual Autoregressive Modeling
di: Qin, Ziran, et al.
Pubblicazione: (2025)
di: Qin, Ziran, et al.
Pubblicazione: (2025)
FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion
di: Hu, Zhanqiu, et al.
Pubblicazione: (2025)
di: Hu, Zhanqiu, et al.
Pubblicazione: (2025)
DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
di: Hao, Jitai, et al.
Pubblicazione: (2026)
di: Hao, Jitai, et al.
Pubblicazione: (2026)
Systolic Sparse Tensor Slices: FPGA Building Blocks for Sparse and Dense AI Acceleration
di: Taka, Endri, et al.
Pubblicazione: (2025)
di: Taka, Endri, et al.
Pubblicazione: (2025)
Training Transformers for KV Cache Compressibility
di: Gelberg, Yoav, et al.
Pubblicazione: (2026)
di: Gelberg, Yoav, et al.
Pubblicazione: (2026)
Lossless KV Cache Compression to 2%
di: Yang, Zhen, et al.
Pubblicazione: (2024)
di: Yang, Zhen, et al.
Pubblicazione: (2024)
KVSculpt: KV Cache Compression as Distillation
di: Jiang, Bo, et al.
Pubblicazione: (2026)
di: Jiang, Bo, et al.
Pubblicazione: (2026)
SemantiCache: Efficient KV Cache Compression via Semantic Chunking and Clustered Merging
di: Wu, Shunlong, et al.
Pubblicazione: (2026)
di: Wu, Shunlong, et al.
Pubblicazione: (2026)
CAKE: Cascading and Adaptive KV Cache Eviction with Layer Preferences
di: Qin, Ziran, et al.
Pubblicazione: (2025)
di: Qin, Ziran, et al.
Pubblicazione: (2025)
KVCompose: Efficient Structured KV Cache Compression with Composite Tokens
di: Akulov, Dmitry, et al.
Pubblicazione: (2025)
di: Akulov, Dmitry, et al.
Pubblicazione: (2025)
A Simple Plug-in for Improving Eviction-Based KV Cache Compression
di: Lin, Yuping, et al.
Pubblicazione: (2026)
di: Lin, Yuping, et al.
Pubblicazione: (2026)
CommVQ: Commutative Vector Quantization for KV Cache Compression
di: Li, Junyan, et al.
Pubblicazione: (2025)
di: Li, Junyan, et al.
Pubblicazione: (2025)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
di: Sun, Hanshi, et al.
Pubblicazione: (2024)
di: Sun, Hanshi, et al.
Pubblicazione: (2024)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
di: Liu, Guangda, et al.
Pubblicazione: (2025)
di: Liu, Guangda, et al.
Pubblicazione: (2025)
Graph-Guided Adaptive Channel Elimination for KV Cache Compression
di: Tong, Enwei, et al.
Pubblicazione: (2026)
di: Tong, Enwei, et al.
Pubblicazione: (2026)
Documenti analoghi
-
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
di: Chang, Chi-Chih, et al.
Pubblicazione: (2025) -
UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025) -
FLRC: Fine-grained Low-Rank Compressor for Efficient LLM Inference
di: Lu, Yu-Chen, et al.
Pubblicazione: (2025) -
SkipCat: Rank-Maximized Low-Rank Compression of Large Language Models via Shared Projection and Block Skipping
di: Lu, Yu-Chen, et al.
Pubblicazione: (2025) -
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
di: Wang, Pei-Shuo, et al.
Pubblicazione: (2025)