Cache Me If You Can: How Many KVs Do You Need for Effective Long-Context LMs?
Fuente:
arXiv
Saved in:
| Main Authors: | Bhaskar, Adithya, Wettig, Alexander, Gao, Tianyu, Dong, Yihe, Chen, Danqi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
How to Train Long-Context Language Models (Effectively)
by: Gao, Tianyu, et al.
Published: (2024)
by: Gao, Tianyu, et al.
Published: (2024)
Finding Transformer Circuits with Edge Pruning
by: Bhaskar, Adithya, et al.
Published: (2024)
by: Bhaskar, Adithya, et al.
Published: (2024)
Extracting Rule-based Descriptions of Attention Features in Transformers
by: Friedman, Dan, et al.
Published: (2025)
by: Friedman, Dan, et al.
Published: (2025)
Metadata Conditioning Accelerates Language Model Pre-training
by: Gao, Tianyu, et al.
Published: (2025)
by: Gao, Tianyu, et al.
Published: (2025)
Improving Language Understanding from Screenshots
by: Gao, Tianyu, et al.
Published: (2024)
by: Gao, Tianyu, et al.
Published: (2024)
Long-Context Language Modeling with Parallel Context Encoding
by: Yen, Howard, et al.
Published: (2024)
by: Yen, Howard, et al.
Published: (2024)
Language Models that Think, Chat Better
by: Bhaskar, Adithya, et al.
Published: (2025)
by: Bhaskar, Adithya, et al.
Published: (2025)
The Heuristic Core: Understanding Subnetwork Generalization in Pretrained Language Models
by: Bhaskar, Adithya, et al.
Published: (2024)
by: Bhaskar, Adithya, et al.
Published: (2024)
HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly
by: Yen, Howard, et al.
Published: (2024)
by: Yen, Howard, et al.
Published: (2024)
Don't Do RAG: When Cache-Augmented Generation is All You Need for Knowledge Tasks
by: Chan, Brian J, et al.
Published: (2024)
by: Chan, Brian J, et al.
Published: (2024)
Augmenting Human Evaluation with LLM Judges: How Many Human Reviews Do You Need?
by: Kim, Jane Paik
Published: (2026)
by: Kim, Jane Paik
Published: (2026)
QuRating: Selecting High-Quality Data for Training Language Models
by: Wettig, Alexander, et al.
Published: (2024)
by: Wettig, Alexander, et al.
Published: (2024)
Continual Memorization of Factoids in Language Models
by: Chen, Howard, et al.
Published: (2024)
by: Chen, Howard, et al.
Published: (2024)
How Many Bytes Can You Take Out Of Brain-To-Text Decoding?
by: Antonello, Richard, et al.
Published: (2024)
by: Antonello, Richard, et al.
Published: (2024)
Mask and You Shall Receive: Optimizing Masked Language Modeling For Pretraining BabyLMs
by: Edman, Lukas, et al.
Published: (2025)
by: Edman, Lukas, et al.
Published: (2025)
Are You There God? Lightweight Narrative Annotation of Christian Fiction with LMs
by: Hicke, Rebecca M. M., et al.
Published: (2025)
by: Hicke, Rebecca M. M., et al.
Published: (2025)
Can't Remember Details in Long Documents? You Need Some R&R
by: Agrawal, Devanshu, et al.
Published: (2024)
by: Agrawal, Devanshu, et al.
Published: (2024)
Catch Me If You Can: How Smaller Reasoning Models Pretend to Reason with Mathematical Fidelity
by: Sahoo, Subramanyam, et al.
Published: (2025)
by: Sahoo, Subramanyam, et al.
Published: (2025)
LongProc: Benchmarking Long-Context Language Models on Long Procedural Generation
by: Ye, Xi, et al.
Published: (2025)
by: Ye, Xi, et al.
Published: (2025)
Is It Really Long Context if All You Need Is Retrieval? Towards Genuinely Difficult Long Context NLP
by: Goldman, Omer, et al.
Published: (2024)
by: Goldman, Omer, et al.
Published: (2024)
Model Tells You Where to Merge: Adaptive KV Cache Merging for LLMs on Long-Context Tasks
by: Wang, Zheng, et al.
Published: (2024)
by: Wang, Zheng, et al.
Published: (2024)
Attention Is All You Need for KV Cache in Diffusion LLMs
by: Nguyen-Tri, Quan, et al.
Published: (2025)
by: Nguyen-Tri, Quan, et al.
Published: (2025)
Organize the Web: Constructing Domains Enhances Pre-Training Data Curation
by: Wettig, Alexander, et al.
Published: (2025)
by: Wettig, Alexander, et al.
Published: (2025)
Trust Me, I Can Convince You: The Contextualized Argument Appraisal Framework
by: Greschner, Lynn, et al.
Published: (2025)
by: Greschner, Lynn, et al.
Published: (2025)
Context Is What You Need: The Maximum Effective Context Window for Real World Limits of LLMs
by: Paulsen, Norman
Published: (2025)
by: Paulsen, Norman
Published: (2025)
Catch Me If You Can Describe Me: Open-Vocabulary Camouflaged Instance Segmentation with Diffusion
by: Vu, Tuan-Anh, et al.
Published: (2023)
by: Vu, Tuan-Anh, et al.
Published: (2023)
Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization
by: Razin, Noam, et al.
Published: (2024)
by: Razin, Noam, et al.
Published: (2024)
Break Me If You Can: Self-Jailbreaking of Aligned LLMs via Lexical Insertion Prompting
by: Kulshreshtha, Devang, et al.
Published: (2026)
by: Kulshreshtha, Devang, et al.
Published: (2026)
Is Depth All You Need? An Exploration of Iterative Reasoning in LLMs
by: Wu, Zongqian, et al.
Published: (2025)
by: Wu, Zongqian, et al.
Published: (2025)
You Only Cache Once: Decoder-Decoder Architectures for Language Models
by: Sun, Yutao, et al.
Published: (2024)
by: Sun, Yutao, et al.
Published: (2024)
Scaling Law in LLM Simulated Personality: More Detailed and Realistic Persona Profile Is All You Need
by: Bai, Yuqi, et al.
Published: (2025)
by: Bai, Yuqi, et al.
Published: (2025)
Cache Me if You Can: Accelerating Diffusion Models through Block Caching
by: Wimbauer, Felix, et al.
Published: (2023)
by: Wimbauer, Felix, et al.
Published: (2023)
Do You Trust Me? Cognitive-Affective Signatures of Trustworthiness in Large Language Models
by: Yeo, Gerard, et al.
Published: (2025)
by: Yeo, Gerard, et al.
Published: (2025)
Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs
by: Ge, Suyu, et al.
Published: (2023)
by: Ge, Suyu, et al.
Published: (2023)
Not All Tokens Are What You Need In Thinking
by: Yuan, Hang, et al.
Published: (2025)
by: Yuan, Hang, et al.
Published: (2025)
Is Grep All You Need? How Agent Harnesses Reshape Agentic Search
by: Sen, Sahil, et al.
Published: (2026)
by: Sen, Sahil, et al.
Published: (2026)
Contrast Is All You Need
by: Kilic, Burak, et al.
Published: (2023)
by: Kilic, Burak, et al.
Published: (2023)
Persuade Me if You Can: A Framework for Evaluating Persuasion Effectiveness and Susceptibility Among Large Language Models
by: Bozdag, Nimet Beyza, et al.
Published: (2025)
by: Bozdag, Nimet Beyza, et al.
Published: (2025)
The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models
by: Ji, Ke, et al.
Published: (2025)
by: Ji, Ke, et al.
Published: (2025)
Attention Is All You Need But You Don't Need All Of It For Inference of Large Language Models
by: Tyukin, Georgy, et al.
Published: (2024)
by: Tyukin, Georgy, et al.
Published: (2024)
Similar Items
-
How to Train Long-Context Language Models (Effectively)
by: Gao, Tianyu, et al.
Published: (2024) -
Finding Transformer Circuits with Edge Pruning
by: Bhaskar, Adithya, et al.
Published: (2024) -
Extracting Rule-based Descriptions of Attention Features in Transformers
by: Friedman, Dan, et al.
Published: (2025) -
Metadata Conditioning Accelerates Language Model Pre-training
by: Gao, Tianyu, et al.
Published: (2025) -
Improving Language Understanding from Screenshots
by: Gao, Tianyu, et al.
Published: (2024)