Finch: Prompt-guided Key-Value Cache Compression
Fuente:
arXiv
Guardado en:
| Autores principales: | Corallo, Giulio, Papotti, Paolo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Parallel Context-of-Experts Decoding for Retrieval Augmented Generation
por: Corallo, Giulio, et al.
Publicado: (2026)
por: Corallo, Giulio, et al.
Publicado: (2026)
Beyond RAG: Task-Aware KV Cache Compression for Comprehensive Knowledge Reasoning
por: Corallo, Giulio, et al.
Publicado: (2025)
por: Corallo, Giulio, et al.
Publicado: (2025)
GoldFinch: High Performance RWKV/Transformer Hybrid with Linear Pre-Fill and Extreme KV-Cache Compression
por: Goldstein, Daniel, et al.
Publicado: (2024)
por: Goldstein, Daniel, et al.
Publicado: (2024)
Rethinking Key-Value Cache Compression Techniques for Large Language Model Serving
por: Gao, Wei, et al.
Publicado: (2025)
por: Gao, Wei, et al.
Publicado: (2025)
Latent Abstractions in Generative Diffusion Models
por: Franzese, Giulio, et al.
Publicado: (2024)
por: Franzese, Giulio, et al.
Publicado: (2024)
Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence
por: Peng, Bo, et al.
Publicado: (2024)
por: Peng, Bo, et al.
Publicado: (2024)
Constraint Decay: The Fragility of LLM Agents in Backend Code Generation
por: Dente, Francesco, et al.
Publicado: (2026)
por: Dente, Francesco, et al.
Publicado: (2026)
Parallel Key-Value Cache Fusion for Position Invariant RAG
por: Oh, Philhoon, et al.
Publicado: (2025)
por: Oh, Philhoon, et al.
Publicado: (2025)
Prompt-Based Value Steering of Large Language Models
por: Abbo, Giulio Antonio, et al.
Publicado: (2025)
por: Abbo, Giulio Antonio, et al.
Publicado: (2025)
RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models
por: Satriani, Dario, et al.
Publicado: (2025)
por: Satriani, Dario, et al.
Publicado: (2025)
Thin Keys, Full Values: Reducing KV Cache via Low-Dimensional Attention Selection
por: Yao, Hengshuai, et al.
Publicado: (2026)
por: Yao, Hengshuai, et al.
Publicado: (2026)
The Pitfalls of KV Cache Compression
por: Chen, Alex, et al.
Publicado: (2025)
por: Chen, Alex, et al.
Publicado: (2025)
Key-Value Pair-Free Continual Learner via Task-Specific Prompt-Prototype
por: Luo, Haihua, et al.
Publicado: (2026)
por: Luo, Haihua, et al.
Publicado: (2026)
WKVQuant: Quantizing Weight and Key/Value Cache for Large Language Models Gains More
por: Yue, Yuxuan, et al.
Publicado: (2024)
por: Yue, Yuxuan, et al.
Publicado: (2024)
Lossless KV Cache Compression to 2%
por: Yang, Zhen, et al.
Publicado: (2024)
por: Yang, Zhen, et al.
Publicado: (2024)
FreqKV: Key-Value Compression in Frequency Domain for Context Window Extension
por: Kai, Jushi, et al.
Publicado: (2025)
por: Kai, Jushi, et al.
Publicado: (2025)
Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference
por: Zhu, Yue, et al.
Publicado: (2025)
por: Zhu, Yue, et al.
Publicado: (2025)
SVDq: 1.25-bit and 410x Key Cache Compression for LLM Attention
por: Yankun, Hong, et al.
Publicado: (2025)
por: Yankun, Hong, et al.
Publicado: (2025)
KV-Runahead: Scalable Causal LLM Inference by Parallel Key-Value Cache Generation
por: Cho, Minsik, et al.
Publicado: (2024)
por: Cho, Minsik, et al.
Publicado: (2024)
Combating Misinformation in the Arab World: Challenges & Opportunities
por: Abouzied, Azza, et al.
Publicado: (2025)
por: Abouzied, Azza, et al.
Publicado: (2025)
An LLM-Based Approach for Insight Generation in Data Analysis
por: Pérez, Alberto Sánchez, et al.
Publicado: (2025)
por: Pérez, Alberto Sánchez, et al.
Publicado: (2025)
When Does Value-Aware KV Eviction Help? A Fixed-Contract Diagnostic for Non-Monotone Cache Compression
por: Zhang, Ruijie, et al.
Publicado: (2026)
por: Zhang, Ruijie, et al.
Publicado: (2026)
Generative Caching for Structurally Similar Prompts and Responses
por: Chakraborty, Sarthak, et al.
Publicado: (2025)
por: Chakraborty, Sarthak, et al.
Publicado: (2025)
KVSculpt: KV Cache Compression as Distillation
por: Jiang, Bo, et al.
Publicado: (2026)
por: Jiang, Bo, et al.
Publicado: (2026)
Adaptive KV-Cache Compression without Manually Setting Budget
por: Tang, Chenxia, et al.
Publicado: (2025)
por: Tang, Chenxia, et al.
Publicado: (2025)
Palu: Compressing KV-Cache with Low-Rank Projection
por: Chang, Chi-Chih, et al.
Publicado: (2024)
por: Chang, Chi-Chih, et al.
Publicado: (2024)
Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression
por: Swain, Kabir, et al.
Publicado: (2026)
por: Swain, Kabir, et al.
Publicado: (2026)
TableCache: Primary Foreign Key Guided KV Cache Precomputation for Low Latency Text-to-SQL
por: Su, Jinbo, et al.
Publicado: (2026)
por: Su, Jinbo, et al.
Publicado: (2026)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
por: Liu, Akide, et al.
Publicado: (2024)
por: Liu, Akide, et al.
Publicado: (2024)
KeyDiff: Key Similarity-Based KV Cache Eviction for Long-Context LLM Inference in Resource-Constrained Environments
por: Park, Junyoung, et al.
Publicado: (2025)
por: Park, Junyoung, et al.
Publicado: (2025)
ThinK: Thinner Key Cache by Query-Driven Pruning
por: Xu, Yuhui, et al.
Publicado: (2024)
por: Xu, Yuhui, et al.
Publicado: (2024)
CommVQ: Commutative Vector Quantization for KV Cache Compression
por: Li, Junyan, et al.
Publicado: (2025)
por: Li, Junyan, et al.
Publicado: (2025)
HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
por: Shi, Zhiyuan, et al.
Publicado: (2026)
por: Shi, Zhiyuan, et al.
Publicado: (2026)
Moment-KV: Momentum-Based Decode-Time KV Cache Compression for Long Generation
por: Jana, Soumyadeep, et al.
Publicado: (2026)
por: Jana, Soumyadeep, et al.
Publicado: (2026)
Meta-Soft: Leveraging Composable Meta-Tokens for Context-Preserving KV Cache Compression
por: Luo, Wei, et al.
Publicado: (2026)
por: Luo, Wei, et al.
Publicado: (2026)
Quantized Keys Steal Attention: Bias Correction for KV-Cache Compression in Video Diffusion
por: Tuncer, Tuna, et al.
Publicado: (2026)
por: Tuncer, Tuna, et al.
Publicado: (2026)
Prompt Cache: Modular Attention Reuse for Low-Latency Inference
por: Gim, In, et al.
Publicado: (2023)
por: Gim, In, et al.
Publicado: (2023)
CompactPrompt: A Unified Pipeline for Prompt Data Compression in LLM Workflows
por: Choi, Joong Ho, et al.
Publicado: (2025)
por: Choi, Joong Ho, et al.
Publicado: (2025)
From Similarity to Vulnerability: Key Collision Attack on LLM Semantic Caching
por: Zhang, Zhixiang, et al.
Publicado: (2026)
por: Zhang, Zhixiang, et al.
Publicado: (2026)
How Much Cache Does Reasoning Need? Depth-Cache Tradeoffs in KV-Compressed Transformers
por: Wang, Xiao
Publicado: (2026)
por: Wang, Xiao
Publicado: (2026)
Ejemplares similares
-
Parallel Context-of-Experts Decoding for Retrieval Augmented Generation
por: Corallo, Giulio, et al.
Publicado: (2026) -
Beyond RAG: Task-Aware KV Cache Compression for Comprehensive Knowledge Reasoning
por: Corallo, Giulio, et al.
Publicado: (2025) -
GoldFinch: High Performance RWKV/Transformer Hybrid with Linear Pre-Fill and Extreme KV-Cache Compression
por: Goldstein, Daniel, et al.
Publicado: (2024) -
Rethinking Key-Value Cache Compression Techniques for Large Language Model Serving
por: Gao, Wei, et al.
Publicado: (2025) -
Latent Abstractions in Generative Diffusion Models
por: Franzese, Giulio, et al.
Publicado: (2024)