Leveraging KV Similarity for Online Structured Pruning in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Jungmin, Byeon, Gwangeun, Kim, Yulhwa, Hong, Seokin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Focus on the Core: Efficient Attention via Pruned Token Compression for Document Classification
par: Yun, Jungmin, et autres
Publié: (2024)
par: Yun, Jungmin, et autres
Publié: (2024)
Towards Threshold-Free KV Cache Pruning
par: Ni, Xuanfan, et autres
Publié: (2025)
par: Ni, Xuanfan, et autres
Publié: (2025)
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
par: Dehghanighobadi, Zahra, et autres
Publié: (2026)
par: Dehghanighobadi, Zahra, et autres
Publié: (2026)
DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
par: Hao, Jitai, et autres
Publié: (2026)
par: Hao, Jitai, et autres
Publié: (2026)
Chopping Trees: Semantic Similarity Based Dynamic Pruning for Tree-of-Thought Reasoning
par: Kim, Joongho, et autres
Publié: (2025)
par: Kim, Joongho, et autres
Publié: (2025)
All-in-One Tuning and Structural Pruning for Domain-Specific LLMs
par: Lu, Lei, et autres
Publié: (2024)
par: Lu, Lei, et autres
Publié: (2024)
KVzap: Fast, Adaptive, and Faithful KV Cache Pruning
par: Jegou, Simon, et autres
Publié: (2026)
par: Jegou, Simon, et autres
Publié: (2026)
KV Cache Steering for Controlling Frozen LLMs
par: Belitsky, Max, et autres
Publié: (2025)
par: Belitsky, Max, et autres
Publié: (2025)
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
par: Gu, Yuzhe, et autres
Publié: (2025)
par: Gu, Yuzhe, et autres
Publié: (2025)
AtlasKV: Augmenting LLMs with Billion-Scale Knowledge Graphs in 20GB VRAM
par: Huang, Haoyu, et autres
Publié: (2025)
par: Huang, Haoyu, et autres
Publié: (2025)
Q-Filters: Leveraging QK Geometry for Efficient KV Cache Compression
par: Godey, Nathan, et autres
Publié: (2025)
par: Godey, Nathan, et autres
Publié: (2025)
Compactor: Calibrated Query-Agnostic KV Cache Compression with Approximate Leverage Scores
par: Chari, Vivek, et autres
Publié: (2025)
par: Chari, Vivek, et autres
Publié: (2025)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
par: Zhu, Yuxuan, et autres
Publié: (2025)
par: Zhu, Yuxuan, et autres
Publié: (2025)
Two-Stage Regularization-Based Structured Pruning for LLMs
par: Feng, Mingkuan, et autres
Publié: (2025)
par: Feng, Mingkuan, et autres
Publié: (2025)
KV-Distill: Nearly Lossless Learnable Context Compression for LLMs
par: Chari, Vivek, et autres
Publié: (2025)
par: Chari, Vivek, et autres
Publié: (2025)
CoBA: Counterbias Text Augmentation for Mitigating Various Spurious Correlations via Semantic Triples
par: Jin, Kyohoon, et autres
Publié: (2025)
par: Jin, Kyohoon, et autres
Publié: (2025)
Multi-News+: Cost-efficient Dataset Cleansing via LLM-based Data Annotation
par: Choi, Juhwan, et autres
Publié: (2024)
par: Choi, Juhwan, et autres
Publié: (2024)
Leveraging LLMs for Structured Data Extraction from Unstructured Patient Records
par: Klusty, Mitchell A., et autres
Publié: (2025)
par: Klusty, Mitchell A., et autres
Publié: (2025)
SemShareKV: Efficient KVCache Sharing for Semantically Similar Prompts via Token-Level LSH Matching
par: Zhao, Xinye, et autres
Publié: (2025)
par: Zhao, Xinye, et autres
Publié: (2025)
FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding Acceleration
par: Jo, Dongwon, et autres
Publié: (2025)
par: Jo, Dongwon, et autres
Publié: (2025)
SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
par: Liao, Huanxuan, et autres
Publié: (2025)
par: Liao, Huanxuan, et autres
Publié: (2025)
2SSP: A Two-Stage Framework for Structured Pruning of LLMs
par: Sandri, Fabrizio, et autres
Publié: (2025)
par: Sandri, Fabrizio, et autres
Publié: (2025)
Can LLMs Recognize Toxicity? A Structured Investigation Framework and Toxicity Metric
par: Koh, Hyukhun, et autres
Publié: (2024)
par: Koh, Hyukhun, et autres
Publié: (2024)
PruneCD: Contrasting Pruned Self Model to Improve Decoding Factuality
par: Yu, Byeongho, et autres
Publié: (2025)
par: Yu, Byeongho, et autres
Publié: (2025)
ZSMerge: Zero-Shot KV Cache Compression for Memory-Efficient Long-Context LLMs
par: Liu, Xin, et autres
Publié: (2025)
par: Liu, Xin, et autres
Publié: (2025)
Crystal-KV: Efficient KV Cache Management for Chain-of-Thought LLMs via Answer-First Principle
par: Wang, Zihan, et autres
Publié: (2026)
par: Wang, Zihan, et autres
Publié: (2026)
M-Wanda: Improving One-Shot Pruning for Multilingual LLMs
par: Choenni, Rochelle, et autres
Publié: (2025)
par: Choenni, Rochelle, et autres
Publié: (2025)
DYCP: Dynamic Context Pruning for Long-Form Dialogue with LLMs
par: Choi, Nayoung, et autres
Publié: (2026)
par: Choi, Nayoung, et autres
Publié: (2026)
CSS: Contrastive Semantic Similarity for Uncertainty Quantification of LLMs
par: Ao, Shuang, et autres
Publié: (2024)
par: Ao, Shuang, et autres
Publié: (2024)
Beyond KV Caching: Shared Attention for Efficient LLMs
par: Liao, Bingli, et autres
Publié: (2024)
par: Liao, Bingli, et autres
Publié: (2024)
Relation-based Counterfactual Data Augmentation and Contrastive Learning for Robustifying Natural Language Inference Models
par: Yang, Heerin, et autres
Publié: (2024)
par: Yang, Heerin, et autres
Publié: (2024)
Reformulating KV Cache Eviction Problem for Long-Context LLM Inference
par: Mai, Tho, et autres
Publié: (2026)
par: Mai, Tho, et autres
Publié: (2026)
G-KV: Decoding-Time KV Cache Eviction with Global Attention
par: Liao, Mengqi, et autres
Publié: (2025)
par: Liao, Mengqi, et autres
Publié: (2025)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
par: Cai, Zefan, et autres
Publié: (2025)
par: Cai, Zefan, et autres
Publié: (2025)
NeuralDB: Scaling Knowledge Editing in LLMs to 100,000 Facts with Neural KV Database
par: Fei, Weizhi, et autres
Publié: (2025)
par: Fei, Weizhi, et autres
Publié: (2025)
REAM: Merging Improves Pruning of Experts in LLMs
par: Jha, Saurav, et autres
Publié: (2026)
par: Jha, Saurav, et autres
Publié: (2026)
Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
par: Wang, Ziyan, et autres
Publié: (2025)
par: Wang, Ziyan, et autres
Publié: (2025)
FineScope : SAE-guided Data Selection Enables Domain Specific LLM Pruning and Finetuning
par: Bhattacharyya, Chaitali, et autres
Publié: (2025)
par: Bhattacharyya, Chaitali, et autres
Publié: (2025)
PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
par: Cai, Zefan, et autres
Publié: (2024)
par: Cai, Zefan, et autres
Publié: (2024)
Attention Is All You Need for KV Cache in Diffusion LLMs
par: Nguyen-Tri, Quan, et autres
Publié: (2025)
par: Nguyen-Tri, Quan, et autres
Publié: (2025)
Documents similaires
-
Focus on the Core: Efficient Attention via Pruned Token Compression for Document Classification
par: Yun, Jungmin, et autres
Publié: (2024) -
Towards Threshold-Free KV Cache Pruning
par: Ni, Xuanfan, et autres
Publié: (2025) -
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
par: Dehghanighobadi, Zahra, et autres
Publié: (2026) -
DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
par: Hao, Jitai, et autres
Publié: (2026) -
Chopping Trees: Semantic Similarity Based Dynamic Pruning for Tree-of-Thought Reasoning
par: Kim, Joongho, et autres
Publié: (2025)