A$^2$ATS: Retrieval-Based KV Cache Reduction via Windowed Rotary Position Embedding and Query-Aware Vector Quantization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Junhui, Xing, Junna, Wang, Nan, Xu, Rui, Wu, Shangyu, Zhou, Peng, Liu, Qiang, Xue, Chun Jason, Li, Qingan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional Embedding
par: Shi, Luohe, et autres
Publié: (2025)
par: Shi, Luohe, et autres
Publié: (2025)
ContiguousKV: Accelerating LLM Prefill with Granularity-Aligned KV Cache Management
par: Zou, Jing, et autres
Publié: (2026)
par: Zou, Jing, et autres
Publié: (2026)
CHESS: Optimizing LLM Inference via Channel-Wise Thresholding and Selective Sparsification
par: He, Junhui, et autres
Publié: (2024)
par: He, Junhui, et autres
Publié: (2024)
MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning
par: Zhang, Tao, et autres
Publié: (2025)
par: Zhang, Tao, et autres
Publié: (2025)
Quantization Dominates Rank Reduction for KV-Cache Compression
par: Salfati, Samuel
Publié: (2026)
par: Salfati, Samuel
Publié: (2026)
CommVQ: Commutative Vector Quantization for KV Cache Compression
par: Li, Junyan, et autres
Publié: (2025)
par: Li, Junyan, et autres
Publié: (2025)
The Rotary Position Embedding May Cause Dimension Inefficiency in Attention Heads for Long-Distance Retrieval
par: Chiang, Ting-Rui, et autres
Publié: (2025)
par: Chiang, Ting-Rui, et autres
Publié: (2025)
WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization
par: Tao, Wei, et autres
Publié: (2026)
par: Tao, Wei, et autres
Publié: (2026)
FibQuant: Universal Vector Quantization for Random-Access KV-Cache Compression
par: Lee, Namyoon, et autres
Publié: (2026)
par: Lee, Namyoon, et autres
Publié: (2026)
Selective Rotary Position Embedding
par: Movahedi, Sajad, et autres
Publié: (2025)
par: Movahedi, Sajad, et autres
Publié: (2025)
AnTKV: Anchor Token-Aware Sub-Bit Vector Quantization for KV Cache in Large Language Models
par: Li, Zeyu, et autres
Publié: (2025)
par: Li, Zeyu, et autres
Publié: (2025)
QVCache: A Query-Aware Vector Cache
par: Göçer, Anıl Eren, et autres
Publié: (2026)
par: Göçer, Anıl Eren, et autres
Publié: (2026)
Length-Aware Rotary Position Embedding for Text-Speech Alignment
par: Kim, Hyeongju, et autres
Publié: (2025)
par: Kim, Hyeongju, et autres
Publié: (2025)
Efficient Matrix Implementation for Rotary Position Embedding
par: Minqi, Chen, et autres
Publié: (2026)
par: Minqi, Chen, et autres
Publié: (2026)
ReFilter: Improving Robustness of Retrieval-Augmented Generation via Gated Filter
par: Chen, Yixin, et autres
Publié: (2026)
par: Chen, Yixin, et autres
Publié: (2026)
WindowKV: Task-Adaptive Group-Wise KV Cache Window Selection for Efficient LLM Inference
par: Zuo, Youhui, et autres
Publié: (2025)
par: Zuo, Youhui, et autres
Publié: (2025)
Beyond Semantic Similarity: Reducing Unnecessary API Calls via Behavior-Aligned Retriever
par: Chen, Yixin, et autres
Publié: (2025)
par: Chen, Yixin, et autres
Publié: (2025)
Rotary Position Embedding for Vision Transformer
par: Heo, Byeongho, et autres
Publié: (2024)
par: Heo, Byeongho, et autres
Publié: (2024)
Context-aware Rotary Position Embedding
par: Veisi, Ali, et autres
Publié: (2025)
par: Veisi, Ali, et autres
Publié: (2025)
Geometry-Aware Rotary Position Embedding for Consistent Video World Model
par: Xiang, Chendong, et autres
Publié: (2026)
par: Xiang, Chendong, et autres
Publié: (2026)
ProphetKV: User-Query-Driven Selective Recomputation for Efficient KV Cache Reuse in Retrieval-Augmented Generation
par: Wang, Shihao, et autres
Publié: (2026)
par: Wang, Shihao, et autres
Publié: (2026)
MrRoPE: Mixed-radix Rotary Position Embedding
par: Tian, Qingyuan, et autres
Publié: (2026)
par: Tian, Qingyuan, et autres
Publié: (2026)
SQuat: Subspace-orthogonal KV Cache Quantization
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
par: Li, Xing, et autres
Publié: (2025)
par: Li, Xing, et autres
Publié: (2025)
DoPE: Denoising Rotary Position Embedding
par: Xiong, Jing, et autres
Publié: (2025)
par: Xiong, Jing, et autres
Publié: (2025)
RedFuser: An Automatic Operator Fusion Framework for Cascaded Reductions on AI Accelerators
par: Tang, Xinsheng, et autres
Publié: (2026)
par: Tang, Xinsheng, et autres
Publié: (2026)
ParisKV: Fast and Drift-Robust KV-Cache Retrieval for Long-Context LLMs
par: Qi, Yanlin, et autres
Publié: (2026)
par: Qi, Yanlin, et autres
Publié: (2026)
SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
par: Liao, Huanxuan, et autres
Publié: (2025)
par: Liao, Huanxuan, et autres
Publié: (2025)
AlignedKV: Reducing Memory Access of KV-Cache with Precision-Aligned Quantization
par: Tan, Yifan, et autres
Publié: (2024)
par: Tan, Yifan, et autres
Publié: (2024)
AsymKV: Enabling 1-Bit Quantization of KV Cache with Layer-Wise Asymmetric Quantization Configurations
par: Tao, Qian, et autres
Publié: (2024)
par: Tao, Qian, et autres
Publié: (2024)
NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache
par: Son, Donghyun, et autres
Publié: (2025)
par: Son, Donghyun, et autres
Publié: (2025)
eOptShrinkQ: Near-Lossless KV Cache Compression Through Optimal Spectral Denoising and Quantization
par: Su, Pei-Chun
Publié: (2026)
par: Su, Pei-Chun
Publié: (2026)
KVmix: Gradient-Based Layer Importance-Aware Mixed-Precision Quantization for KV Cache
par: Li, Fei, et autres
Publié: (2025)
par: Li, Fei, et autres
Publié: (2025)
OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization
par: Zhou, Zhongzhu, et autres
Publié: (2026)
par: Zhou, Zhongzhu, et autres
Publié: (2026)
RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations
par: Su, Zunhai, et autres
Publié: (2025)
par: Su, Zunhai, et autres
Publié: (2025)
Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression
par: Swain, Kabir, et autres
Publié: (2026)
par: Swain, Kabir, et autres
Publié: (2026)
QAQ: Quality Adaptive Quantization for LLM KV Cache
par: Dong, Shichen, et autres
Publié: (2024)
par: Dong, Shichen, et autres
Publié: (2024)
PolarQuant: Quantizing KV Caches with Polar Transformation
par: Han, Insu, et autres
Publié: (2025)
par: Han, Insu, et autres
Publié: (2025)
Accurate KV Cache Quantization with Outlier Tokens Tracing
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
Learning Where to Embed: Noise-Aware Positional Embedding for Query Retrieval in Small-Object Detection
par: Zeng, Yangchen, et autres
Publié: (2026)
par: Zeng, Yangchen, et autres
Publié: (2026)
Documents similaires
-
KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional Embedding
par: Shi, Luohe, et autres
Publié: (2025) -
ContiguousKV: Accelerating LLM Prefill with Granularity-Aligned KV Cache Management
par: Zou, Jing, et autres
Publié: (2026) -
CHESS: Optimizing LLM Inference via Channel-Wise Thresholding and Selective Sparsification
par: He, Junhui, et autres
Publié: (2024) -
MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning
par: Zhang, Tao, et autres
Publié: (2025) -
Quantization Dominates Rank Reduction for KV-Cache Compression
par: Salfati, Samuel
Publié: (2026)