PolarQuant: Quantizing KV Caches with Polar Transformation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Insu, Kacham, Praneeth, Karbasi, Amin, Mirrokni, Vahab, Zandieh, Amir |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SubGen: Token Generation in Sublinear Time and Memory
par: Zandieh, Amir, et autres
Publié: (2024)
par: Zandieh, Amir, et autres
Publié: (2024)
QJL: 1-Bit Quantized JL Transform for KV Cache Quantization with Zero Overhead
par: Zandieh, Amir, et autres
Publié: (2024)
par: Zandieh, Amir, et autres
Publié: (2024)
TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate
par: Zandieh, Amir, et autres
Publié: (2025)
par: Zandieh, Amir, et autres
Publié: (2025)
ECO: Quantized Training without Full-Precision Master Weights
par: Nikdan, Mahdi, et autres
Publié: (2026)
par: Nikdan, Mahdi, et autres
Publié: (2026)
PolarQuant: Leveraging Polar Transformation for Efficient Key Cache Quantization and Decoding Acceleration
par: Wu, Songhao, et autres
Publié: (2025)
par: Wu, Songhao, et autres
Publié: (2025)
PolySketchFormer: Fast Transformers via Sketching Polynomial Kernels
par: Kacham, Praneeth, et autres
Publié: (2023)
par: Kacham, Praneeth, et autres
Publié: (2023)
QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache
par: Tiwari, Rishabh, et autres
Publié: (2025)
par: Tiwari, Rishabh, et autres
Publié: (2025)
TNT: Improving Chunkwise Training for Test-Time Memorization
par: Li, Zeman, et autres
Publié: (2025)
par: Li, Zeman, et autres
Publié: (2025)
Trellis: Learning to Compress Key-Value Memory in Attention Models
par: Karami, Mahdi, et autres
Publié: (2025)
par: Karami, Mahdi, et autres
Publié: (2025)
FibQuant: Universal Vector Quantization for Random-Access KV-Cache Compression
par: Lee, Namyoon, et autres
Publié: (2026)
par: Lee, Namyoon, et autres
Publié: (2026)
LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation
par: Chen, Han, et autres
Publié: (2025)
par: Chen, Han, et autres
Publié: (2025)
PolarQuant: Optimal Gaussian Weight Quantization via Hadamard Rotation for LLM Compression
par: Vicentino, Caio
Publié: (2026)
par: Vicentino, Caio
Publié: (2026)
Memory Caching: RNNs with Growing Memory
par: Behrouz, Ali, et autres
Publié: (2026)
par: Behrouz, Ali, et autres
Publié: (2026)
Streaming Attention Approximation via Discrepancy Theory
par: Kochetkova, Ekaterina, et autres
Publié: (2025)
par: Kochetkova, Ekaterina, et autres
Publié: (2025)
Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression
par: Swain, Kabir, et autres
Publié: (2026)
par: Swain, Kabir, et autres
Publié: (2026)
Lattice: Learning to Efficiently Compress the Memory
par: Karami, Mahdi, et autres
Publié: (2025)
par: Karami, Mahdi, et autres
Publié: (2025)
Understanding the Role of Training Data in Test-Time Scaling
par: Javanmard, Adel, et autres
Publié: (2025)
par: Javanmard, Adel, et autres
Publié: (2025)
Theoretical Perspectives on Data Quality and Synergistic Effects in Pre- and Post-Training Reasoning Models
par: Javanmard, Adel, et autres
Publié: (2026)
par: Javanmard, Adel, et autres
Publié: (2026)
AsymKV: Enabling 1-Bit Quantization of KV Cache with Layer-Wise Asymmetric Quantization Configurations
par: Tao, Qian, et autres
Publié: (2024)
par: Tao, Qian, et autres
Publié: (2024)
ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification
par: He, Yefei, et autres
Publié: (2024)
par: He, Yefei, et autres
Publié: (2024)
SQuat: Subspace-orthogonal KV Cache Quantization
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
Titans: Learning to Memorize at Test Time
par: Behrouz, Ali, et autres
Publié: (2024)
par: Behrouz, Ali, et autres
Publié: (2024)
It's All Connected: A Journey Through Test-Time Memorization, Attentional Bias, Retention, and Online Optimization
par: Behrouz, Ali, et autres
Publié: (2025)
par: Behrouz, Ali, et autres
Publié: (2025)
Sampling and Loss Weights in Multi-Domain Training
par: Salmani, Mahdi, et autres
Publié: (2025)
par: Salmani, Mahdi, et autres
Publié: (2025)
Nested Learning: The Illusion of Deep Learning Architectures
par: Behrouz, Ali, et autres
Publié: (2025)
par: Behrouz, Ali, et autres
Publié: (2025)
Optimistic Rates for Learning from Label Proportions
par: Li, Gene, et autres
Publié: (2024)
par: Li, Gene, et autres
Publié: (2024)
Quantization Dominates Rank Reduction for KV-Cache Compression
par: Salfati, Samuel
Publié: (2026)
par: Salfati, Samuel
Publié: (2026)
RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache
par: Zhang, Junkai, et autres
Publié: (2026)
par: Zhang, Junkai, et autres
Publié: (2026)
HeadQ: Model-Visible Distortion and Score-Space Correction for KV-Cache Quantization
par: Williams, Jorge L. Ruiz
Publié: (2026)
par: Williams, Jorge L. Ruiz
Publié: (2026)
TurboAngle: Near-Lossless KV Cache Compression via Uniform Angle Quantization
par: Patel, Dipkumar
Publié: (2026)
par: Patel, Dipkumar
Publié: (2026)
Gödel Test: Can Large Language Models Solve Easy Conjectures?
par: Feldman, Moran, et autres
Publié: (2025)
par: Feldman, Moran, et autres
Publié: (2025)
The Pitfalls of KV Cache Compression
par: Chen, Alex, et autres
Publié: (2025)
par: Chen, Alex, et autres
Publié: (2025)
Understanding Transformer Reasoning Capabilities via Graph Algorithms
par: Sanford, Clayton, et autres
Publié: (2024)
par: Sanford, Clayton, et autres
Publié: (2024)
MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning
par: Zhang, Tao, et autres
Publié: (2025)
par: Zhang, Tao, et autres
Publié: (2025)
KV Cache Quantization for Self-Forcing Video Generation: A 33-Method Empirical Study
par: Ranganath, Suraj, et autres
Publié: (2026)
par: Ranganath, Suraj, et autres
Publié: (2026)
NQKV: A KV Cache Quantization Scheme Based on Normal Distribution Characteristics
par: Cai, Zhihang, et autres
Publié: (2025)
par: Cai, Zhihang, et autres
Publié: (2025)
Replicable Clustering
par: Esfandiari, Hossein, et autres
Publié: (2023)
par: Esfandiari, Hossein, et autres
Publié: (2023)
NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache
par: Son, Donghyun, et autres
Publié: (2025)
par: Son, Donghyun, et autres
Publié: (2025)
Kitty: Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost
par: Xia, Haojun, et autres
Publié: (2025)
par: Xia, Haojun, et autres
Publié: (2025)
No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization
par: Yang, June Yong, et autres
Publié: (2024)
par: Yang, June Yong, et autres
Publié: (2024)
Documents similaires
-
SubGen: Token Generation in Sublinear Time and Memory
par: Zandieh, Amir, et autres
Publié: (2024) -
QJL: 1-Bit Quantized JL Transform for KV Cache Quantization with Zero Overhead
par: Zandieh, Amir, et autres
Publié: (2024) -
TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate
par: Zandieh, Amir, et autres
Publié: (2025) -
ECO: Quantized Training without Full-Precision Master Weights
par: Nikdan, Mahdi, et autres
Publié: (2026) -
PolarQuant: Leveraging Polar Transformation for Efficient Key Cache Quantization and Decoding Acceleration
par: Wu, Songhao, et autres
Publié: (2025)