Quantize What Counts: More for Keys, Less for Values
Fuente:
arXiv
Guardado en:
| Autores principales: | Hariri, Mohsen, Luo, Alan, Chen, Weicong, Zhong, Shaochen, Zhang, Tianyi, Wang, Qifan, Hu, Xia, Han, Xiaotian, Chaudhary, Vipin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float (DFloat11)
por: Zhang, Tianyi, et al.
Publicado: (2025)
por: Zhang, Tianyi, et al.
Publicado: (2025)
100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?
por: Yang, Wang, et al.
Publicado: (2025)
por: Yang, Wang, et al.
Publicado: (2025)
$K^4$: Online Log Anomaly Detection Via Unsupervised Typicality Learning
por: Chen, Weicong, et al.
Publicado: (2025)
por: Chen, Weicong, et al.
Publicado: (2025)
Scorio.jl: A Julia package for ranking stochastic responses
por: Hariri, Mohsen, et al.
Publicado: (2026)
por: Hariri, Mohsen, et al.
Publicado: (2026)
Ranking Reasoning LLMs under Test-Time Scaling
por: Hariri, Mohsen, et al.
Publicado: (2026)
por: Hariri, Mohsen, et al.
Publicado: (2026)
Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation
por: Hariri, Mohsen, et al.
Publicado: (2025)
por: Hariri, Mohsen, et al.
Publicado: (2025)
Demystifying Hybrid Thinking: Can LLMs Truly Switch Between Think and No-Think?
por: Wang, Shouren, et al.
Publicado: (2025)
por: Wang, Shouren, et al.
Publicado: (2025)
SELF: Self-Extend the Context Length With Logistic Growth Function
por: Dang, Phat Thanh, et al.
Publicado: (2025)
por: Dang, Phat Thanh, et al.
Publicado: (2025)
Reliability-Gated Source Anchoring for Continual Test-Time Adaptation
por: Singh, Vikash, et al.
Publicado: (2026)
por: Singh, Vikash, et al.
Publicado: (2026)
Medical Image Spatial Grounding with Semantic Sampling
por: Yu, Andrew Seohwan, et al.
Publicado: (2026)
por: Yu, Andrew Seohwan, et al.
Publicado: (2026)
Thinking Preference Optimization
por: Yang, Wang, et al.
Publicado: (2025)
por: Yang, Wang, et al.
Publicado: (2025)
Robust Ultra-High-Dimensional Variable Selection With Correlated Structure Using Group Testing
por: Guo, Wanru, et al.
Publicado: (2026)
por: Guo, Wanru, et al.
Publicado: (2026)
CausalGuard: Conformal Inference under Graph Uncertainty
por: Singh, Vikash, et al.
Publicado: (2026)
por: Singh, Vikash, et al.
Publicado: (2026)
KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache
por: Liu, Zirui, et al.
Publicado: (2024)
por: Liu, Zirui, et al.
Publicado: (2024)
Longer Context, Deeper Thinking: Uncovering the Role of Long-Context Ability in Reasoning
por: Yang, Wang, et al.
Publicado: (2025)
por: Yang, Wang, et al.
Publicado: (2025)
Winner-Take-All Column Row Sampling for Memory Efficient Adaptation of Language Model
por: Liu, Zirui, et al.
Publicado: (2023)
por: Liu, Zirui, et al.
Publicado: (2023)
Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification
por: Guo, Yiju, et al.
Publicado: (2026)
por: Guo, Yiju, et al.
Publicado: (2026)
AutoL2S: Auto Long-Short Reasoning for Efficient Large Language Models
por: Luo, Feng, et al.
Publicado: (2025)
por: Luo, Feng, et al.
Publicado: (2025)
FFB: A Fair Fairness Benchmark for In-Processing Group Fairness Methods
por: Han, Xiaotian, et al.
Publicado: (2023)
por: Han, Xiaotian, et al.
Publicado: (2023)
WKVQuant: Quantizing Weight and Key/Value Cache for Large Language Models Gains More
por: Yue, Yuxuan, et al.
Publicado: (2024)
por: Yue, Yuxuan, et al.
Publicado: (2024)
Trust The Typical
por: Ganguly, Debargha, et al.
Publicado: (2026)
por: Ganguly, Debargha, et al.
Publicado: (2026)
Taylor Unswift: Secured Weight Release for Large Language Models via Taylor Expansion
por: Wang, Guanchu, et al.
Publicado: (2024)
por: Wang, Guanchu, et al.
Publicado: (2024)
Novel adaptation of video segmentation to 3D MRI: efficient zero-shot knee segmentation with SAM2
por: Yu, Andrew Seohwan, et al.
Publicado: (2024)
por: Yu, Andrew Seohwan, et al.
Publicado: (2024)
When Less is More: The LLM Scaling Paradox in Context Compression
por: Guo, Ruishan, et al.
Publicado: (2026)
por: Guo, Ruishan, et al.
Publicado: (2026)
When Less is More: 8-bit Quantization Improves Continual Learning in Large Language Models
por: Zhang, Michael S., et al.
Publicado: (2025)
por: Zhang, Michael S., et al.
Publicado: (2025)
Speculative Thinking: Enhancing Small-Model Reasoning with Large Model Guidance at Inference Time
por: Yang, Wang, et al.
Publicado: (2025)
por: Yang, Wang, et al.
Publicado: (2025)
Less is More: Parameter-Efficient Selection of Intermediate Tasks for Transfer Learning
por: Schulte, David, et al.
Publicado: (2024)
por: Schulte, David, et al.
Publicado: (2024)
Less is More: Improving LLM Alignment via Preference Data Selection
por: Deng, Xun, et al.
Publicado: (2025)
por: Deng, Xun, et al.
Publicado: (2025)
Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers
por: Yang, Wang, et al.
Publicado: (2026)
por: Yang, Wang, et al.
Publicado: (2026)
Forget Less, Generalize More: Unifying Temporal and Structural Adaptation for Dynamic Graphs
por: Chang, Qian, et al.
Publicado: (2026)
por: Chang, Qian, et al.
Publicado: (2026)
Less Random, More Private: What is the Optimal Subsampling Scheme for DP-SGD?
por: Dong, Andy, et al.
Publicado: (2026)
por: Dong, Andy, et al.
Publicado: (2026)
Less or More From Teacher: Exploiting Trilateral Geometry For Knowledge Distillation
por: Hu, Chengming, et al.
Publicado: (2023)
por: Hu, Chengming, et al.
Publicado: (2023)
Visual Concept Networks: A Graph-Based Approach to Detecting Anomalous Data in Deep Neural Networks
por: Ganguly, Debargha, et al.
Publicado: (2024)
por: Ganguly, Debargha, et al.
Publicado: (2024)
When Less is More: On the Value of "Co-training" for Semi-Supervised Software Defect Predictors
por: Majumder, Suvodeep, et al.
Publicado: (2022)
por: Majumder, Suvodeep, et al.
Publicado: (2022)
Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding
por: Shen, Yuhao, et al.
Publicado: (2026)
por: Shen, Yuhao, et al.
Publicado: (2026)
SKVQ: Sliding-window Key and Value Cache Quantization for Large Language Models
por: Duanmu, Haojie, et al.
Publicado: (2024)
por: Duanmu, Haojie, et al.
Publicado: (2024)
Less is More: Pseudo-Label Filtering for Continual Test-Time Adaptation
por: Tan, Jiayao, et al.
Publicado: (2024)
por: Tan, Jiayao, et al.
Publicado: (2024)
When Domains Interact: Asymmetric and Order-Sensitive Cross-Domain Effects in Reinforcement Learning for Reasoning
por: Yang, Wang, et al.
Publicado: (2026)
por: Yang, Wang, et al.
Publicado: (2026)
LoRATK: LoRA Once, Backdoor Everywhere in the Share-and-Play Ecosystem
por: Liu, Hongyi, et al.
Publicado: (2024)
por: Liu, Hongyi, et al.
Publicado: (2024)
Transformer Multivariate Forecasting: Less is More?
por: Xu, Jingjing, et al.
Publicado: (2023)
por: Xu, Jingjing, et al.
Publicado: (2023)
Ejemplares similares
-
70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float (DFloat11)
por: Zhang, Tianyi, et al.
Publicado: (2025) -
100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?
por: Yang, Wang, et al.
Publicado: (2025) -
$K^4$: Online Log Anomaly Detection Via Unsupervised Typicality Learning
por: Chen, Weicong, et al.
Publicado: (2025) -
Scorio.jl: A Julia package for ranking stochastic responses
por: Hariri, Mohsen, et al.
Publicado: (2026) -
Ranking Reasoning LLMs under Test-Time Scaling
por: Hariri, Mohsen, et al.
Publicado: (2026)