LoopGuard: Breaking Self-Reinforcing Attention Loops via Dynamic KV Cache Intervention
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Dongjie, Wu, Hao, Shi, Weijie, Cui, Yue, Liu, Yuanjun, Li, Jiawei, Ma, Haolun, Liu, An, Zhu, Jia, Xu, Jiajie |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cognitive-Uncertainty Guided Knowledge Distillation for Accurate Classification of Student Misconceptions
par: Liu, Qirui, et autres
Publié: (2026)
par: Liu, Qirui, et autres
Publié: (2026)
Escher-Loop: Mutual Evolution by Closed-Loop Self-Referential Optimization
par: Liu, Ziyang, et autres
Publié: (2026)
par: Liu, Ziyang, et autres
Publié: (2026)
PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
par: Cai, Zefan, et autres
Publié: (2024)
par: Cai, Zefan, et autres
Publié: (2024)
Adaptation Method for Misinformation Identification
par: Chen, Yangping, et autres
Publié: (2025)
par: Chen, Yangping, et autres
Publié: (2025)
Efficient Serving for Dynamic Agent Workflows with Prediction-based KV-Cache Management
par: Zheng, Haoyu, et autres
Publié: (2026)
par: Zheng, Haoyu, et autres
Publié: (2026)
Sparse Attention across Multiple-context KV Cache
par: Cao, Ziyi, et autres
Publié: (2025)
par: Cao, Ziyi, et autres
Publié: (2025)
LoopRPT: Reinforcement Pre-Training for Looped Language Models
par: Tang, Guo, et autres
Publié: (2026)
par: Tang, Guo, et autres
Publié: (2026)
AttentionPredictor: Temporal Patterns Matter for KV Cache Compression
par: Yang, Qingyue, et autres
Publié: (2025)
par: Yang, Qingyue, et autres
Publié: (2025)
SQuat: Subspace-orthogonal KV Cache Quantization
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads
par: He, Xingyang, et autres
Publié: (2025)
par: He, Xingyang, et autres
Publié: (2025)
E3-Rewrite: Learning to Rewrite SQL for Executability, Equivalence,and Efficiency
par: Xu, Dongjie, et autres
Publié: (2025)
par: Xu, Dongjie, et autres
Publié: (2025)
In-context KV-Cache Eviction for LLMs via Attention-Gate
par: Zeng, Zihao, et autres
Publié: (2024)
par: Zeng, Zihao, et autres
Publié: (2024)
SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs
par: Li, Jiawei, et autres
Publié: (2026)
par: Li, Jiawei, et autres
Publié: (2026)
Cross-Self KV Cache Pruning for Efficient Vision-Language Inference
par: Pei, Xiaohuan, et autres
Publié: (2024)
par: Pei, Xiaohuan, et autres
Publié: (2024)
Homogeneous Keys, Heterogeneous Values: Exploiting Local KV Cache Asymmetry for Long-Context LLMs
par: Cui, Wanyun, et autres
Publié: (2025)
par: Cui, Wanyun, et autres
Publié: (2025)
GraphKV: Breaking the Static Selection Paradigm with Graph-Based KV Cache Eviction
par: Li, Xuelin, et autres
Publié: (2025)
par: Li, Xuelin, et autres
Publié: (2025)
Zero-Shot Cellular Trajectory Map Matching
par: Shi, Weijie, et autres
Publié: (2025)
par: Shi, Weijie, et autres
Publié: (2025)
G-KV: Decoding-Time KV Cache Eviction with Global Attention
par: Liao, Mengqi, et autres
Publié: (2025)
par: Liao, Mengqi, et autres
Publié: (2025)
AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models
par: Gu, Yifeng, et autres
Publié: (2025)
par: Gu, Yifeng, et autres
Publié: (2025)
Lookahead Q-Cache: Achieving More Consistent KV Cache Eviction via Pseudo Query
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
Adaptive KV-Cache Compression without Manually Setting Budget
par: Tang, Chenxia, et autres
Publié: (2025)
par: Tang, Chenxia, et autres
Publié: (2025)
ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase Partition
par: Ye, Lu, et autres
Publié: (2024)
par: Ye, Lu, et autres
Publié: (2024)
Breaking the Loop: Detecting and Mitigating Denial-of-Service Vulnerabilities in Large Language Models
par: Yu, Junzhe, et autres
Publié: (2025)
par: Yu, Junzhe, et autres
Publié: (2025)
PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference
par: Yang, Dongjie, et autres
Publié: (2024)
par: Yang, Dongjie, et autres
Publié: (2024)
Ship Detection in SAR Images with Human-in-the-Loop
par: Jia, Hecheng, et autres
Publié: (2024)
par: Jia, Hecheng, et autres
Publié: (2024)
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
par: Ma, Da, et autres
Publié: (2024)
par: Ma, Da, et autres
Publié: (2024)
RefreshKV: Updating Small KV Cache During Long-form Generation
par: Xu, Fangyuan, et autres
Publié: (2024)
par: Xu, Fangyuan, et autres
Publié: (2024)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
par: Liu, Xiang, et autres
Publié: (2025)
par: Liu, Xiang, et autres
Publié: (2025)
KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing
par: Yang, Yifei, et autres
Publié: (2024)
par: Yang, Yifei, et autres
Publié: (2024)
Some Bounds on the Energy of Graphs with Self-Loops regarding $λ_{1}$ and $λ_{n}$
par: Li, Minghua, et autres
Publié: (2024)
par: Li, Minghua, et autres
Publié: (2024)
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
par: Zhou, Xiabin, et autres
Publié: (2024)
par: Zhou, Xiabin, et autres
Publié: (2024)
DioR: Adaptive Cognitive Detection and Contextual Retrieval Optimization for Dynamic Retrieval-Augmented Generation
par: Guo, Hanghui, et autres
Publié: (2025)
par: Guo, Hanghui, et autres
Publié: (2025)
Towards Threshold-Free KV Cache Pruning
par: Ni, Xuanfan, et autres
Publié: (2025)
par: Ni, Xuanfan, et autres
Publié: (2025)
Transactional Attention: Semantic Sponsorship for KV-Cache Retention
par: Basu, Abhinaba
Publié: (2026)
par: Basu, Abhinaba
Publié: (2026)
Beyond KV Caching: Shared Attention for Efficient LLMs
par: Liao, Bingli, et autres
Publié: (2024)
par: Liao, Bingli, et autres
Publié: (2024)
Circular Reasoning: Understanding Self-Reinforcing Loops in Large Reasoning Models
par: Duan, Zenghao, et autres
Publié: (2026)
par: Duan, Zenghao, et autres
Publié: (2026)
XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization
par: Tomar, Aditya, et autres
Publié: (2025)
par: Tomar, Aditya, et autres
Publié: (2025)
Beyond Homogeneous Attention: Memory-Efficient LLMs via Fourier-Approximated KV Cache
par: Liu, Xiaoran, et autres
Publié: (2025)
par: Liu, Xiaoran, et autres
Publié: (2025)
ACR: Adaptive Context Refactoring via Context Refactoring Operators for Multi-Turn Dialogue
par: Shen, Jiawei, et autres
Publié: (2026)
par: Shen, Jiawei, et autres
Publié: (2026)
Eigen Attention: Attention in Low-Rank Space for KV Cache Compression
par: Saxena, Utkarsh, et autres
Publié: (2024)
par: Saxena, Utkarsh, et autres
Publié: (2024)
Documents similaires
-
Cognitive-Uncertainty Guided Knowledge Distillation for Accurate Classification of Student Misconceptions
par: Liu, Qirui, et autres
Publié: (2026) -
Escher-Loop: Mutual Evolution by Closed-Loop Self-Referential Optimization
par: Liu, Ziyang, et autres
Publié: (2026) -
PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
par: Cai, Zefan, et autres
Publié: (2024) -
Adaptation Method for Misinformation Identification
par: Chen, Yangping, et autres
Publié: (2025) -
Efficient Serving for Dynamic Agent Workflows with Prediction-based KV-Cache Management
par: Zheng, Haoyu, et autres
Publié: (2026)