ThinK: Thinner Key Cache by Query-Driven Pruning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Yuhui, Jie, Zhanming, Dong, Hanze, Wang, Lei, Lu, Xudong, Zhou, Aojun, Saha, Amrita, Xiong, Caiming, Sahoo, Doyen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Automatic Curriculum Expert Iteration for Reliable LLM Reasoning
par: Zhao, Zirui, et autres
Publié: (2024)
par: Zhao, Zirui, et autres
Publié: (2024)
Scalable Chain of Thoughts via Elastic Reasoning
par: Xu, Yuhui, et autres
Publié: (2025)
par: Xu, Yuhui, et autres
Publié: (2025)
MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs
par: Wang, Lei, et autres
Publié: (2024)
par: Wang, Lei, et autres
Publié: (2024)
Fractured Chain-of-Thought Reasoning
par: Liao, Baohao, et autres
Publié: (2025)
par: Liao, Baohao, et autres
Publié: (2025)
XForecast: Evaluating Natural Language Explanations for Time Series Forecasting
par: Aksu, Taha, et autres
Publié: (2024)
par: Aksu, Taha, et autres
Publié: (2024)
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
par: Liao, Baohao, et autres
Publié: (2025)
par: Liao, Baohao, et autres
Publié: (2025)
Entropy-Based Block Pruning for Efficient Large Language Models
par: Yang, Liangwei, et autres
Publié: (2025)
par: Yang, Liangwei, et autres
Publié: (2025)
Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models
par: Hu, Zhiyuan, et autres
Publié: (2025)
par: Hu, Zhiyuan, et autres
Publié: (2025)
Reward Models Identify Consistency, Not Causality
par: Xu, Yuhui, et autres
Publié: (2025)
par: Xu, Yuhui, et autres
Publié: (2025)
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction
par: Xu, Yiheng, et autres
Publié: (2024)
par: Xu, Yiheng, et autres
Publié: (2024)
RLHF Workflow: From Reward Modeling to Online RLHF
par: Dong, Hanze, et autres
Publié: (2024)
par: Dong, Hanze, et autres
Publié: (2024)
INDICT: Code Generation with Internal Dialogues of Critiques for Both Security and Helpfulness
par: Le, Hung, et autres
Publié: (2024)
par: Le, Hung, et autres
Publié: (2024)
Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models
par: Lu, Xudong, et autres
Publié: (2024)
par: Lu, Xudong, et autres
Publié: (2024)
MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers
par: Luo, Ziyang, et autres
Publié: (2025)
par: Luo, Ziyang, et autres
Publié: (2025)
CodeTree: Agent-guided Tree Search for Code Generation with Large Language Models
par: Li, Jierui, et autres
Publié: (2024)
par: Li, Jierui, et autres
Publié: (2024)
CodeChain: Towards Modular Code Generation Through Chain of Self-revisions with Representative Sub-modules
par: Le, Hung, et autres
Publié: (2023)
par: Le, Hung, et autres
Publié: (2023)
Unified Training of Universal Time Series Forecasting Transformers
par: Woo, Gerald, et autres
Publié: (2024)
par: Woo, Gerald, et autres
Publié: (2024)
SPP: Sparsity-Preserved Parameter-Efficient Fine-Tuning for Large Language Models
par: Lu, Xudong, et autres
Publié: (2024)
par: Lu, Xudong, et autres
Publié: (2024)
SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
par: Liao, Huanxuan, et autres
Publié: (2025)
par: Liao, Huanxuan, et autres
Publié: (2025)
PerfCodeGen: Improving Performance of LLM Generated Code with Execution Feedback
par: Peng, Yun, et autres
Publié: (2024)
par: Peng, Yun, et autres
Publié: (2024)
BOLT: Bootstrap Long Chain-of-Thought in Language Models without Distillation
par: Pang, Bo, et autres
Publié: (2025)
par: Pang, Bo, et autres
Publié: (2025)
Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions
par: Zhang, David Junhao, et autres
Publié: (2024)
par: Zhang, David Junhao, et autres
Publié: (2024)
UniTST: Effectively Modeling Inter-Series and Intra-Series Dependencies for Multivariate Time Series Forecasting
par: Liu, Juncheng, et autres
Publié: (2024)
par: Liu, Juncheng, et autres
Publié: (2024)
GIFT-Eval: A Benchmark For General Time Series Forecasting Model Evaluation
par: Aksu, Taha, et autres
Publié: (2024)
par: Aksu, Taha, et autres
Publié: (2024)
Thinner Cortex, Sharper Attention? Paradoxical Links Between Cortical Thinning and Attentional Capacity in Cognitive Aging
par: Yi Jin Leow, et autres
Publié: (2025)
par: Yi Jin Leow, et autres
Publié: (2025)
LeanK: Learnable K Cache Channel Pruning for Efficient Decoding
par: Zhang, Yike, et autres
Publié: (2025)
par: Zhang, Yike, et autres
Publié: (2025)
Towards Threshold-Free KV Cache Pruning
par: Ni, Xuanfan, et autres
Publié: (2025)
par: Ni, Xuanfan, et autres
Publié: (2025)
Empowering Time Series Analysis with Synthetic Data: A Survey and Outlook in the Era of Foundation Models
par: Liu, Xu, et autres
Publié: (2025)
par: Liu, Xu, et autres
Publié: (2025)
Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts
par: Liu, Xu, et autres
Publié: (2024)
par: Liu, Xu, et autres
Publié: (2024)
Moirai 2.0: When Less Is More for Time Series Forecasting
par: Liu, Chenghao, et autres
Publié: (2025)
par: Liu, Chenghao, et autres
Publié: (2025)
TerDiT: Ternary Diffusion Models with Transformers
par: Lu, Xudong, et autres
Publié: (2024)
par: Lu, Xudong, et autres
Publié: (2024)
On Secure Gradient Coding with Uncoded Groupwise Keys
par: You, Xudong, et autres
Publié: (2026)
par: You, Xudong, et autres
Publié: (2026)
Thinner Latent Spaces: Detecting Dimension and Imposing Invariance with Conformal Autoencoders
par: Kevrekidis, George A., et autres
Publié: (2024)
par: Kevrekidis, George A., et autres
Publié: (2024)
Thinner Tibial Spine Fracture Fragments Are Associated With Risk of Fixation Failure
par: Gregory Benes, et autres
Publié: (2024)
par: Gregory Benes, et autres
Publié: (2024)
SpeCache: Speculative Key-Value Caching for Efficient Generation of LLMs
par: Jie, Shibo, et autres
Publié: (2025)
par: Jie, Shibo, et autres
Publié: (2025)
Beyond Uniform Query Distribution: Key-Driven Grouped Query Attention
par: Khan, Zohaib, et autres
Publié: (2024)
par: Khan, Zohaib, et autres
Publié: (2024)
Scaling Computer-Use Grounding via User Interface Decomposition and Synthesis
par: Xie, Tianbao, et autres
Publié: (2025)
par: Xie, Tianbao, et autres
Publié: (2025)
GUI-KV: Efficient GUI Agents via KV Cache with Spatio-Temporal Awareness
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
DiFache: Efficient and Scalable Caching on Disaggregated Memory using Decentralized Coherence
par: Zhang, Hanze, et autres
Publié: (2025)
par: Zhang, Hanze, et autres
Publié: (2025)
Documents similaires
-
Automatic Curriculum Expert Iteration for Reliable LLM Reasoning
par: Zhao, Zirui, et autres
Publié: (2024) -
Scalable Chain of Thoughts via Elastic Reasoning
par: Xu, Yuhui, et autres
Publié: (2025) -
MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs
par: Wang, Lei, et autres
Publié: (2024) -
Fractured Chain-of-Thought Reasoning
par: Liao, Baohao, et autres
Publié: (2025) -
XForecast: Evaluating Natural Language Explanations for Time Series Forecasting
par: Aksu, Taha, et autres
Publié: (2024)