SideQuest: Model-Driven KV Cache Management for Long-Horizon Agentic Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Kariyappa, Sanjay, Suh, G. Edward |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Stronger Enforcement of Instruction Hierarchy via Augmented Intermediate Representations
di: Kariyappa, Sanjay, et al.
Pubblicazione: (2025)
di: Kariyappa, Sanjay, et al.
Pubblicazione: (2025)
CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM
di: Li, Yubo, et al.
Pubblicazione: (2026)
di: Li, Yubo, et al.
Pubblicazione: (2026)
ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing
di: Chen, Kaiwen, et al.
Pubblicazione: (2025)
di: Chen, Kaiwen, et al.
Pubblicazione: (2025)
IceCache: Memory-efficient KV-cache Management for Long-Sequence LLMs
di: Mao, Yuzhen, et al.
Pubblicazione: (2026)
di: Mao, Yuzhen, et al.
Pubblicazione: (2026)
LouisKV: Efficient KV Cache Retrieval for Long Input-Output Sequences
di: Wu, Wenbo, et al.
Pubblicazione: (2025)
di: Wu, Wenbo, et al.
Pubblicazione: (2025)
Hierarchical Adaptive Eviction for KV Cache Management in Multimodal Language Models
di: Ma, Xindian, et al.
Pubblicazione: (2026)
di: Ma, Xindian, et al.
Pubblicazione: (2026)
MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning
di: Zhang, Tao, et al.
Pubblicazione: (2025)
di: Zhang, Tao, et al.
Pubblicazione: (2025)
Leyline: KV Cache Directives for Agentic Inference
di: Ma, Bole, et al.
Pubblicazione: (2026)
di: Ma, Bole, et al.
Pubblicazione: (2026)
Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression
di: Zhou, Bowen, et al.
Pubblicazione: (2026)
di: Zhou, Bowen, et al.
Pubblicazione: (2026)
The Pitfalls of KV Cache Compression
di: Chen, Alex, et al.
Pubblicazione: (2025)
di: Chen, Alex, et al.
Pubblicazione: (2025)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
di: Shi, Dachuan, et al.
Pubblicazione: (2025)
di: Shi, Dachuan, et al.
Pubblicazione: (2025)
Beyond Speedup -- Utilizing KV Cache for Sampling and Reasoning
di: Xing, Zeyu, et al.
Pubblicazione: (2026)
di: Xing, Zeyu, et al.
Pubblicazione: (2026)
CacheClip: Accelerating RAG with Effective KV Cache Reuse
di: Yang, Bin, et al.
Pubblicazione: (2025)
di: Yang, Bin, et al.
Pubblicazione: (2025)
Progressive Inference: Explaining Decoder-Only Sequence Classification Models Using Intermediate Predictions
di: Kariyappa, Sanjay, et al.
Pubblicazione: (2024)
di: Kariyappa, Sanjay, et al.
Pubblicazione: (2024)
KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs
di: Chen, Chuangtao, et al.
Pubblicazione: (2026)
di: Chen, Chuangtao, et al.
Pubblicazione: (2026)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
CoKV: Optimizing KV Cache Allocation via Cooperative Game
di: Sun, Qiheng, et al.
Pubblicazione: (2025)
di: Sun, Qiheng, et al.
Pubblicazione: (2025)
SmallKV: Small Model Assisted Compensation of KV Cache Compression for Efficient LLM Inference
di: Zhao, Yi, et al.
Pubblicazione: (2025)
di: Zhao, Yi, et al.
Pubblicazione: (2025)
Bottlenecked Transformers: Periodic KV Cache Consolidation for Generalised Reasoning
di: Oomerjee, Adnan, et al.
Pubblicazione: (2025)
di: Oomerjee, Adnan, et al.
Pubblicazione: (2025)
ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models
di: Liu, Xiaogeng, et al.
Pubblicazione: (2026)
di: Liu, Xiaogeng, et al.
Pubblicazione: (2026)
How Much Cache Does Reasoning Need? Depth-Cache Tradeoffs in KV-Compressed Transformers
di: Wang, Xiao
Pubblicazione: (2026)
di: Wang, Xiao
Pubblicazione: (2026)
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
di: Li, Kunxi, et al.
Pubblicazione: (2025)
di: Li, Kunxi, et al.
Pubblicazione: (2025)
Crystal-KV: Efficient KV Cache Management for Chain-of-Thought LLMs via Answer-First Principle
di: Wang, Zihan, et al.
Pubblicazione: (2026)
di: Wang, Zihan, et al.
Pubblicazione: (2026)
RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse
di: Geng, Yingsheng, et al.
Pubblicazione: (2026)
di: Geng, Yingsheng, et al.
Pubblicazione: (2026)
ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification
di: He, Yefei, et al.
Pubblicazione: (2024)
di: He, Yefei, et al.
Pubblicazione: (2024)
Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs
di: Bui, Ngoc, et al.
Pubblicazione: (2025)
di: Bui, Ngoc, et al.
Pubblicazione: (2025)
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
di: Dzikanyanga, Gradwell, et al.
Pubblicazione: (2026)
di: Dzikanyanga, Gradwell, et al.
Pubblicazione: (2026)
AgenticCache: Cache-Driven Asynchronous Planning for Embodied AI Agents
di: Kim, Hojoon, et al.
Pubblicazione: (2026)
di: Kim, Hojoon, et al.
Pubblicazione: (2026)
LookaheadKV: Fast and Accurate KV Cache Eviction by Glimpsing into the Future without Generation
di: Ahn, Jinwoo, et al.
Pubblicazione: (2026)
di: Ahn, Jinwoo, et al.
Pubblicazione: (2026)
Enhancing Large Multimodal Models with Adaptive Sparsity and KV Cache Compression
di: Zhang, Te, et al.
Pubblicazione: (2025)
di: Zhang, Te, et al.
Pubblicazione: (2025)
AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications
di: Zhao, Yujie, et al.
Pubblicazione: (2026)
di: Zhao, Yujie, et al.
Pubblicazione: (2026)
Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks
di: He, Shuo, et al.
Pubblicazione: (2026)
di: He, Shuo, et al.
Pubblicazione: (2026)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
di: Liu, Akide, et al.
Pubblicazione: (2024)
di: Liu, Akide, et al.
Pubblicazione: (2024)
Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression
di: Swain, Kabir, et al.
Pubblicazione: (2026)
di: Swain, Kabir, et al.
Pubblicazione: (2026)
Palu: Compressing KV-Cache with Low-Rank Projection
di: Chang, Chi-Chih, et al.
Pubblicazione: (2024)
di: Chang, Chi-Chih, et al.
Pubblicazione: (2024)
PolarQuant: Quantizing KV Caches with Polar Transformation
di: Han, Insu, et al.
Pubblicazione: (2025)
di: Han, Insu, et al.
Pubblicazione: (2025)
KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference
di: Nadali, Alireza, et al.
Pubblicazione: (2026)
di: Nadali, Alireza, et al.
Pubblicazione: (2026)
ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression
di: Liu, Guangda, et al.
Pubblicazione: (2024)
di: Liu, Guangda, et al.
Pubblicazione: (2024)
CSKV: Training-Efficient Channel Shrinking for KV Cache in Long-Context Scenarios
di: Wang, Luning, et al.
Pubblicazione: (2024)
di: Wang, Luning, et al.
Pubblicazione: (2024)
KVSculpt: KV Cache Compression as Distillation
di: Jiang, Bo, et al.
Pubblicazione: (2026)
di: Jiang, Bo, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Stronger Enforcement of Instruction Hierarchy via Augmented Intermediate Representations
di: Kariyappa, Sanjay, et al.
Pubblicazione: (2025) -
CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM
di: Li, Yubo, et al.
Pubblicazione: (2026) -
ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing
di: Chen, Kaiwen, et al.
Pubblicazione: (2025) -
IceCache: Memory-efficient KV-cache Management for Long-Sequence LLMs
di: Mao, Yuzhen, et al.
Pubblicazione: (2026) -
LouisKV: Efficient KV Cache Retrieval for Long Input-Output Sequences
di: Wu, Wenbo, et al.
Pubblicazione: (2025)