Enregistré dans:
| Auteurs principaux: | Wang, Yixuan, Shi, Qingyu, Zhou, Jiayu, Liu, Dianbo, He, Ziwei, Lin, Zhouhan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2603.16435 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
One Size Does Not Fit All: Token-Wise Adaptive Compression for KV Cache
par: Lu, Liming, et autres
Publié: (2026)
par: Lu, Liming, et autres
Publié: (2026)
FreqKV: Key-Value Compression in Frequency Domain for Context Window Extension
par: Kai, Jushi, et autres
Publié: (2025)
par: Kai, Jushi, et autres
Publié: (2025)
CommVQ: Commutative Vector Quantization for KV Cache Compression
par: Li, Junyan, et autres
Publié: (2025)
par: Li, Junyan, et autres
Publié: (2025)
PonderLM-2: Pretraining LLM with Latent Thoughts in Continuous Space
par: Zeng, Boyi, et autres
Publié: (2025)
par: Zeng, Boyi, et autres
Publié: (2025)
Mitigating Premature Discretization with Progressive Quantization for Robust Vector Tokenization
par: Zhao, Wenhao, et autres
Publié: (2026)
par: Zhao, Wenhao, et autres
Publié: (2026)
AWM: Accurate Weight-Matrix Fingerprint for Large Language Models
par: Zeng, Boyi, et autres
Publié: (2025)
par: Zeng, Boyi, et autres
Publié: (2025)
CoDAR: Continuous Diffusion Language Models are More Powerful Than You Think
par: Shen, Junzhe, et autres
Publié: (2026)
par: Shen, Junzhe, et autres
Publié: (2026)
QAQ: Quality Adaptive Quantization for LLM KV Cache
par: Dong, Shichen, et autres
Publié: (2024)
par: Dong, Shichen, et autres
Publié: (2024)
EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction
par: Ji, Shiyu, et autres
Publié: (2026)
par: Ji, Shiyu, et autres
Publié: (2026)
AdaPonderLM: Gated Pondering Language Models with Token-Wise Adaptive Depth
par: Song, Shixiang, et autres
Publié: (2026)
par: Song, Shixiang, et autres
Publié: (2026)
PonderLM: Pretraining Language Models to Ponder in Continuous Space
par: Zeng, Boyi, et autres
Publié: (2025)
par: Zeng, Boyi, et autres
Publié: (2025)
VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization
par: Yao, Dingyu, et autres
Publié: (2025)
par: Yao, Dingyu, et autres
Publié: (2025)
Balance of Number of Embedding and their Dimensions in Vector Quantization
par: Chen, Hang, et autres
Publié: (2024)
par: Chen, Hang, et autres
Publié: (2024)
TreeKV: Smooth Key-Value Cache Compression with Tree Structures
par: He, Ziwei, et autres
Publié: (2025)
par: He, Ziwei, et autres
Publié: (2025)
A$^2$ATS: Retrieval-Based KV Cache Reduction via Windowed Rotary Position Embedding and Query-Aware Vector Quantization
par: He, Junhui, et autres
Publié: (2025)
par: He, Junhui, et autres
Publié: (2025)
Fourier Transformer: Fast Long Range Modeling by Removing Sequence Redundancy with FFT Operator
par: He, Ziwei, et autres
Publié: (2023)
par: He, Ziwei, et autres
Publié: (2023)
Towards Controlled Table-to-Text Generation with Scientific Reasoning
par: Guo, Zhixin, et autres
Publié: (2023)
par: Guo, Zhixin, et autres
Publié: (2023)
PonderLM-3: Adaptive Token-Wise Pondering with Differentiable Masking
par: Li, He, et autres
Publié: (2026)
par: Li, He, et autres
Publié: (2026)
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
par: Chang, Chi-Chih, et autres
Publié: (2025)
par: Chang, Chi-Chih, et autres
Publié: (2025)
Unlocking Data-free Low-bit Quantization with Matrix Decomposition for KV Cache Compression
par: Liu, Peiyu, et autres
Publié: (2024)
par: Liu, Peiyu, et autres
Publié: (2024)
Quantization Dominates Rank Reduction for KV-Cache Compression
par: Salfati, Samuel
Publié: (2026)
par: Salfati, Samuel
Publié: (2026)
XQuant: Achieving Ultra-Low Bit KV Cache Quantization with Cross-Layer Compression
par: Yang, Haoqi, et autres
Publié: (2025)
par: Yang, Haoqi, et autres
Publié: (2025)
Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression
par: Liu, Xiang, et autres
Publié: (2025)
par: Liu, Xiang, et autres
Publié: (2025)
KV-CoRE: Benchmarking Data-Dependent Low-Rank Compressibility of KV-Caches in LLMs
par: Chen, Jian, et autres
Publié: (2026)
par: Chen, Jian, et autres
Publié: (2026)
AnTKV: Anchor Token-Aware Sub-Bit Vector Quantization for KV Cache in Large Language Models
par: Li, Zeyu, et autres
Publié: (2025)
par: Li, Zeyu, et autres
Publié: (2025)
SemantiCache: Efficient KV Cache Compression via Semantic Chunking and Clustered Merging
par: Wu, Shunlong, et autres
Publié: (2026)
par: Wu, Shunlong, et autres
Publié: (2026)
SCOPE: Optimizing Key-Value Cache Compression in Long-context Generation
par: Wu, Jialong, et autres
Publié: (2024)
par: Wu, Jialong, et autres
Publié: (2024)
VQ-Logits: Compressing the Output Bottleneck of Large Language Models via Vector Quantized Logits
par: Shao, Jintian, et autres
Publié: (2025)
par: Shao, Jintian, et autres
Publié: (2025)
PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference
par: Yang, Dongjie, et autres
Publié: (2024)
par: Yang, Dongjie, et autres
Publié: (2024)
Beyond Homogeneous Attention: Memory-Efficient LLMs via Fourier-Approximated KV Cache
par: Liu, Xiaoran, et autres
Publié: (2025)
par: Liu, Xiaoran, et autres
Publié: (2025)
Lookahead Q-Cache: Achieving More Consistent KV Cache Eviction via Pseudo Query
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
Next Concept Prediction in Discrete Latent Space Leads to Stronger Language Models
par: Liu, Yuliang, et autres
Publié: (2026)
par: Liu, Yuliang, et autres
Publié: (2026)
CRVQ: Channel-Relaxed Vector Quantization for Extreme Compression of LLMs
par: Xu, Yuzhuang, et autres
Publié: (2024)
par: Xu, Yuzhuang, et autres
Publié: (2024)
Accurate KV Cache Quantization with Outlier Tokens Tracing
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
par: Shi, Zhiyuan, et autres
Publié: (2026)
par: Shi, Zhiyuan, et autres
Publié: (2026)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
par: Liu, Akide, et autres
Publié: (2024)
par: Liu, Akide, et autres
Publié: (2024)
OpenBA-V2: Reaching 77.3% High Compression Ratio with Fast Multi-Stage Pruning
par: Qiao, Dan, et autres
Publié: (2024)
par: Qiao, Dan, et autres
Publié: (2024)
CaliDrop: KV Cache Compression with Calibration
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
Multi-Novelty: Improve the Diversity and Novelty of Contents Generated by Large Language Models via inference-time Multi-Views Brainstorming
par: Lagzian, Arash, et autres
Publié: (2025)
par: Lagzian, Arash, et autres
Publié: (2025)
More Human, More Efficient: Aligning Annotations with Quantized SLMs
par: Wang, Jiayu, et autres
Publié: (2026)
par: Wang, Jiayu, et autres
Publié: (2026)
Documents similaires
-
One Size Does Not Fit All: Token-Wise Adaptive Compression for KV Cache
par: Lu, Liming, et autres
Publié: (2026) -
FreqKV: Key-Value Compression in Frequency Domain for Context Window Extension
par: Kai, Jushi, et autres
Publié: (2025) -
CommVQ: Commutative Vector Quantization for KV Cache Compression
par: Li, Junyan, et autres
Publié: (2025) -
PonderLM-2: Pretraining LLM with Latent Thoughts in Continuous Space
par: Zeng, Boyi, et autres
Publié: (2025) -
Mitigating Premature Discretization with Progressive Quantization for Robust Vector Tokenization
par: Zhao, Wenhao, et autres
Publié: (2026)