AnTKV: Anchor Token-Aware Sub-Bit Vector Quantization for KV Cache in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zeyu, Xiao, Chuanfu, Wang, Yang, Liu, Xiang, Tang, Zhenheng, Lu, Baotong, Yang, Mao, Chen, Xinyu, Chu, Xiaowen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
por: Liu, Xiang, et al.
Publicado: (2025)
por: Liu, Xiang, et al.
Publicado: (2025)
Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression
por: Liu, Xiang, et al.
Publicado: (2025)
por: Liu, Xiang, et al.
Publicado: (2025)
Accurate KV Cache Quantization with Outlier Tokens Tracing
por: Su, Yi, et al.
Publicado: (2025)
por: Su, Yi, et al.
Publicado: (2025)
VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization
por: Yao, Dingyu, et al.
Publicado: (2025)
por: Yao, Dingyu, et al.
Publicado: (2025)
Plug-and-Play 1.x-Bit KV Cache Quantization for Video Large Language Models
por: Tao, Keda, et al.
Publicado: (2025)
por: Tao, Keda, et al.
Publicado: (2025)
NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache
por: Son, Donghyun, et al.
Publicado: (2025)
por: Son, Donghyun, et al.
Publicado: (2025)
AsymKV: Enabling 1-Bit Quantization of KV Cache with Layer-Wise Asymmetric Quantization Configurations
por: Tao, Qian, et al.
Publicado: (2024)
por: Tao, Qian, et al.
Publicado: (2024)
CommVQ: Commutative Vector Quantization for KV Cache Compression
por: Li, Junyan, et al.
Publicado: (2025)
por: Li, Junyan, et al.
Publicado: (2025)
No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization
por: Yang, June Yong, et al.
Publicado: (2024)
por: Yang, June Yong, et al.
Publicado: (2024)
XQuant: Achieving Ultra-Low Bit KV Cache Quantization with Cross-Layer Compression
por: Yang, Haoqi, et al.
Publicado: (2025)
por: Yang, Haoqi, et al.
Publicado: (2025)
RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations
por: Su, Zunhai, et al.
Publicado: (2025)
por: Su, Zunhai, et al.
Publicado: (2025)
BitDecoding: Unlocking Tensor Cores for Long-Context LLMs with Low-Bit KV Cache
por: Du, Dayou, et al.
Publicado: (2025)
por: Du, Dayou, et al.
Publicado: (2025)
CalibQuant: 1-Bit KV Cache Quantization for Multimodal LLMs
por: Han, Insu, et al.
Publicado: (2025)
por: Han, Insu, et al.
Publicado: (2025)
KEEP: A KV-Cache-Centric Memory Management System for Efficient Embodied Planning
por: Yang, Zebin, et al.
Publicado: (2026)
por: Yang, Zebin, et al.
Publicado: (2026)
QJL: 1-Bit Quantized JL Transform for KV Cache Quantization with Zero Overhead
por: Zandieh, Amir, et al.
Publicado: (2024)
por: Zandieh, Amir, et al.
Publicado: (2024)
AKVQ-VL: Attention-Aware KV Cache Adaptive 2-Bit Quantization for Vision-Language Models
por: Su, Zunhai, et al.
Publicado: (2025)
por: Su, Zunhai, et al.
Publicado: (2025)
ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification
por: He, Yefei, et al.
Publicado: (2024)
por: He, Yefei, et al.
Publicado: (2024)
Don't Waste Bits! Adaptive KV-Cache Quantization for Lightweight On-Device LLMs
por: Boroujeni, Sayed Pedram Haeri, et al.
Publicado: (2026)
por: Boroujeni, Sayed Pedram Haeri, et al.
Publicado: (2026)
RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache
por: Zhang, Junkai, et al.
Publicado: (2026)
por: Zhang, Junkai, et al.
Publicado: (2026)
LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation
por: Chen, Han, et al.
Publicado: (2025)
por: Chen, Han, et al.
Publicado: (2025)
KV Cache is 1 Bit Per Channel: Efficient Large Language Model Inference with Coupled Quantization
por: Zhang, Tianyi, et al.
Publicado: (2024)
por: Zhang, Tianyi, et al.
Publicado: (2024)
SAW-INT4: System-Aware 4-Bit KV-Cache Quantization for Real-World LLM Serving
por: Jia, Jinda, et al.
Publicado: (2026)
por: Jia, Jinda, et al.
Publicado: (2026)
FlowKV: Enhancing Multi-Turn Conversational Coherence in LLMs via Isolated Key-Value Cache Management
por: Liu, Xiang, et al.
Publicado: (2025)
por: Liu, Xiang, et al.
Publicado: (2025)
MorphServe: Efficient and Workload-Aware LLM Serving via Runtime Quantized Layer Swapping and KV Cache Resizing
por: Su, Zhaoyuan, et al.
Publicado: (2025)
por: Su, Zhaoyuan, et al.
Publicado: (2025)
On the Spectral Flattening of Quantized Embeddings
por: Huang, Junlin, et al.
Publicado: (2026)
por: Huang, Junlin, et al.
Publicado: (2026)
FibQuant: Universal Vector Quantization for Random-Access KV-Cache Compression
por: Lee, Namyoon, et al.
Publicado: (2026)
por: Lee, Namyoon, et al.
Publicado: (2026)
Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization
por: Xi, Haocheng, et al.
Publicado: (2026)
por: Xi, Haocheng, et al.
Publicado: (2026)
ExpertFlow: Efficient Mixture-of-Experts Inference via Predictive Expert Caching and Token Scheduling
por: He, Xin, et al.
Publicado: (2024)
por: He, Xin, et al.
Publicado: (2024)
HOSCF: Efficient decoupling algorithms for finding the best rank-one approximation of higher-order tensors
por: Xiao, Chuanfu, et al.
Publicado: (2024)
por: Xiao, Chuanfu, et al.
Publicado: (2024)
CTkvr: KV Cache Retrieval for Long-Context LLMs via Centroid then Token Indexing
por: Lu, Kuan, et al.
Publicado: (2025)
por: Lu, Kuan, et al.
Publicado: (2025)
Position: LLM Inference Should Be Evaluated as Energy-to-Token Production
por: Liu, Xiang, et al.
Publicado: (2026)
por: Liu, Xiang, et al.
Publicado: (2026)
Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration
por: Chen, Peilin, et al.
Publicado: (2025)
por: Chen, Peilin, et al.
Publicado: (2025)
Should We Really Edit Language Models? On the Evaluation of Edited Language Models
por: Li, Qi, et al.
Publicado: (2024)
por: Li, Qi, et al.
Publicado: (2024)
A Token/KV-Cache Communication Media Selection and Resource Allocation Strategy for Multi-Agent Collaboration
por: Dai, Lipeng, et al.
Publicado: (2026)
por: Dai, Lipeng, et al.
Publicado: (2026)
Subkv: Quantizing Long Context KV Cache for Sub‐Billion Parameter Language Models on Edge Devices
por: Ziqian Zeng, et al.
Publicado: (2025)
por: Ziqian Zeng, et al.
Publicado: (2025)
BitDance: Scaling Autoregressive Generative Models with Binary Tokens
por: Ai, Yuang, et al.
Publicado: (2026)
por: Ai, Yuang, et al.
Publicado: (2026)
InnerQ: Hardware-Aware Tuning-Free Quantization of KV Cache for Large Language Models
por: Hosseini, Sayed Mohammadreza Tayaranian, et al.
Publicado: (2026)
por: Hosseini, Sayed Mohammadreza Tayaranian, et al.
Publicado: (2026)
OmniReview: A Large-scale Benchmark and LLM-enhanced Framework for Realistic Reviewer Recommendation
por: Huang, Yehua, et al.
Publicado: (2026)
por: Huang, Yehua, et al.
Publicado: (2026)
SQuat: Subspace-orthogonal KV Cache Quantization
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
BitDistiller: Unleashing the Potential of Sub-4-Bit LLMs via Self-Distillation
por: Du, Dayou, et al.
Publicado: (2024)
por: Du, Dayou, et al.
Publicado: (2024)
Ejemplares similares
-
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
por: Liu, Xiang, et al.
Publicado: (2025) -
Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression
por: Liu, Xiang, et al.
Publicado: (2025) -
Accurate KV Cache Quantization with Outlier Tokens Tracing
por: Su, Yi, et al.
Publicado: (2025) -
VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization
por: Yao, Dingyu, et al.
Publicado: (2025) -
Plug-and-Play 1.x-Bit KV Cache Quantization for Video Large Language Models
por: Tao, Keda, et al.
Publicado: (2025)