Echo: KV-Cache-Free Associative Recall with Spectral Koopman Operators
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sridhar, Anupama, Johansen, Alexander |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Convergence of Adam in Deep ReLU Networks via Directional Complexity and Kakeya Bounds
par: Sridhar, Anupama, et autres
Publié: (2025)
par: Sridhar, Anupama, et autres
Publié: (2025)
Convergence of TD(0) under Polynomial Mixing with Nonlinear Function Approximation
par: Sridhar, Anupama, et autres
Publié: (2025)
par: Sridhar, Anupama, et autres
Publié: (2025)
ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression
par: Liu, Guangda, et autres
Publié: (2024)
par: Liu, Guangda, et autres
Publié: (2024)
Breaking the KV Cache Bottleneck: Fan Duality Model Achieves O(1) Decode Memory with Superior Associative Recall
par: Fan, Yasong
Publié: (2026)
par: Fan, Yasong
Publié: (2026)
KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs
par: Chen, Chuangtao, et autres
Publié: (2026)
par: Chen, Chuangtao, et autres
Publié: (2026)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
par: Liu, Guangda, et autres
Publié: (2025)
par: Liu, Guangda, et autres
Publié: (2025)
ManifoldKV: Training-Free KV Cache Compression via Euclidean Outlier Detection
par: Datta, Debajyoti, et autres
Publié: (2026)
par: Datta, Debajyoti, et autres
Publié: (2026)
Training Transformers for KV Cache Compressibility
par: Gelberg, Yoav, et autres
Publié: (2026)
par: Gelberg, Yoav, et autres
Publié: (2026)
KV-CAR: KV Cache Compression using Autoencoders and KV Reuse in Large Language Models
par: Roy, Sourjya, et autres
Publié: (2025)
par: Roy, Sourjya, et autres
Publié: (2025)
ShadowServe: Interference-Free KV Cache Fetching for Distributed Prefix Caching
par: Xiang, Xingyu, et autres
Publié: (2025)
par: Xiang, Xingyu, et autres
Publié: (2025)
The Pitfalls of KV Cache Compression
par: Chen, Alex, et autres
Publié: (2025)
par: Chen, Alex, et autres
Publié: (2025)
AlignedKV: Reducing Memory Access of KV-Cache with Precision-Aligned Quantization
par: Tan, Yifan, et autres
Publié: (2024)
par: Tan, Yifan, et autres
Publié: (2024)
ThinKV: Thought-Adaptive KV Cache Compression for Efficient Reasoning Models
par: Ramachandran, Akshat, et autres
Publié: (2025)
par: Ramachandran, Akshat, et autres
Publié: (2025)
Compute Or Load KV Cache? Why Not Both?
par: Jin, Shuowei, et autres
Publié: (2024)
par: Jin, Shuowei, et autres
Publié: (2024)
CacheClip: Accelerating RAG with Effective KV Cache Reuse
par: Yang, Bin, et autres
Publié: (2025)
par: Yang, Bin, et autres
Publié: (2025)
Training-Free Exponential Context Extension via Cascading KV Cache
par: Willette, Jeffrey, et autres
Publié: (2024)
par: Willette, Jeffrey, et autres
Publié: (2024)
MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference
par: Li, Yu, et autres
Publié: (2026)
par: Li, Yu, et autres
Publié: (2026)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
CoKV: Optimizing KV Cache Allocation via Cooperative Game
par: Sun, Qiheng, et autres
Publié: (2025)
par: Sun, Qiheng, et autres
Publié: (2025)
KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache
par: Liu, Zirui, et autres
Publié: (2024)
par: Liu, Zirui, et autres
Publié: (2024)
Generative Modeling through Koopman Spectral Analysis: An Operator-Theoretic Perspective
par: Xu, Yuanchao, et autres
Publié: (2025)
par: Xu, Yuanchao, et autres
Publié: (2025)
FlexiCache: Leveraging Temporal Stability of Attention Heads for Efficient KV Cache Management
par: Takbir, Nazmul, et autres
Publié: (2025)
par: Takbir, Nazmul, et autres
Publié: (2025)
VeriCache: Turning Lossy KV Cache into Lossless LLM Inference
par: Yao, Jiayi, et autres
Publié: (2026)
par: Yao, Jiayi, et autres
Publié: (2026)
KV Pareto: Systems-Level Optimization of KV Cache and Model Compression for Long Context Inference
par: Gokhale, Sai, et autres
Publié: (2025)
par: Gokhale, Sai, et autres
Publié: (2025)
LouisKV: Efficient KV Cache Retrieval for Long Input-Output Sequences
par: Wu, Wenbo, et autres
Publié: (2025)
par: Wu, Wenbo, et autres
Publié: (2025)
InnerQ: Hardware-Aware Tuning-Free Quantization of KV Cache for Large Language Models
par: Hosseini, Sayed Mohammadreza Tayaranian, et autres
Publié: (2026)
par: Hosseini, Sayed Mohammadreza Tayaranian, et autres
Publié: (2026)
TriAxialKV: Toward Extreme Low-Precision KV-Cache Quantization for Agentic Inference Tasks
par: Shen, Hanzhang, et autres
Publié: (2026)
par: Shen, Hanzhang, et autres
Publié: (2026)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
par: Yu, Bohan, et autres
Publié: (2025)
par: Yu, Bohan, et autres
Publié: (2025)
KVSculpt: KV Cache Compression as Distillation
par: Jiang, Bo, et autres
Publié: (2026)
par: Jiang, Bo, et autres
Publié: (2026)
RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse
par: Geng, Yingsheng, et autres
Publié: (2026)
par: Geng, Yingsheng, et autres
Publié: (2026)
ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification
par: He, Yefei, et autres
Publié: (2024)
par: He, Yefei, et autres
Publié: (2024)
Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs
par: Bui, Ngoc, et autres
Publié: (2025)
par: Bui, Ngoc, et autres
Publié: (2025)
KVCompose: Efficient Structured KV Cache Compression with Composite Tokens
par: Akulov, Dmitry, et autres
Publié: (2025)
par: Akulov, Dmitry, et autres
Publié: (2025)
LookaheadKV: Fast and Accurate KV Cache Eviction by Glimpsing into the Future without Generation
par: Ahn, Jinwoo, et autres
Publié: (2026)
par: Ahn, Jinwoo, et autres
Publié: (2026)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
par: Sun, Hanshi, et autres
Publié: (2024)
par: Sun, Hanshi, et autres
Publié: (2024)
FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding Acceleration
par: Jo, Dongwon, et autres
Publié: (2025)
par: Jo, Dongwon, et autres
Publié: (2025)
eOptShrinkQ: Near-Lossless KV Cache Compression Through Optimal Spectral Denoising and Quantization
par: Su, Pei-Chun
Publié: (2026)
par: Su, Pei-Chun
Publié: (2026)
NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache
par: Son, Donghyun, et autres
Publié: (2025)
par: Son, Donghyun, et autres
Publié: (2025)
Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression
par: Swain, Kabir, et autres
Publié: (2026)
par: Swain, Kabir, et autres
Publié: (2026)
ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing
par: Chen, Kaiwen, et autres
Publié: (2025)
par: Chen, Kaiwen, et autres
Publié: (2025)
Documents similaires
-
Convergence of Adam in Deep ReLU Networks via Directional Complexity and Kakeya Bounds
par: Sridhar, Anupama, et autres
Publié: (2025) -
Convergence of TD(0) under Polynomial Mixing with Nonlinear Function Approximation
par: Sridhar, Anupama, et autres
Publié: (2025) -
ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression
par: Liu, Guangda, et autres
Publié: (2024) -
Breaking the KV Cache Bottleneck: Fan Duality Model Achieves O(1) Decode Memory with Superior Associative Recall
par: Fan, Yasong
Publié: (2026) -
KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs
par: Chen, Chuangtao, et autres
Publié: (2026)