SPA-Cache: Singular Proxies for Adaptive Caching in Diffusion Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Wenhao, Tu, Rong-Cheng, Ding, Yifu, Jin, Zhao, Liao, Jingyi, Jing, Yongcheng, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Diffusion Model-Based Video Editing: A Survey
par: Sun, Wenhao, et autres
Publié: (2024)
par: Sun, Wenhao, et autres
Publié: (2024)
Lightning Fast Caching-based Parallel Denoising Prediction for Accelerating Talking Head Generation
par: Long, Jianzhi, et autres
Publié: (2025)
par: Long, Jianzhi, et autres
Publié: (2025)
dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching
par: Liu, Zhiyuan, et autres
Publié: (2025)
par: Liu, Zhiyuan, et autres
Publié: (2025)
VORTA: Efficient Video Diffusion via Routing Sparse Attention
par: Sun, Wenhao, et autres
Publié: (2025)
par: Sun, Wenhao, et autres
Publié: (2025)
AsymRnR: Video Diffusion Transformers Acceleration with Asymmetric Reduction and Restoration
par: Sun, Wenhao, et autres
Publié: (2024)
par: Sun, Wenhao, et autres
Publié: (2024)
Hierarchical Adaptive Eviction for KV Cache Management in Multimodal Language Models
par: Ma, Xindian, et autres
Publié: (2026)
par: Ma, Xindian, et autres
Publié: (2026)
SPAgent: Adaptive Task Decomposition and Model Selection for General Video Generation and Editing
par: Tu, Rong-Cheng, et autres
Publié: (2024)
par: Tu, Rong-Cheng, et autres
Publié: (2024)
Block-wise Adaptive Caching for Accelerating Diffusion Policy
par: Ji, Kangye, et autres
Publié: (2025)
par: Ji, Kangye, et autres
Publié: (2025)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
par: Liu, Akide, et autres
Publié: (2024)
par: Liu, Akide, et autres
Publié: (2024)
MedCoG: Maximizing LLM Inference Density in Medical Reasoning via Meta-Cognitive Regulation
par: Zhao, Yu, et autres
Publié: (2026)
par: Zhao, Yu, et autres
Publié: (2026)
AB-Cache: Training-Free Acceleration of Diffusion Models via Adams-Bashforth Cached Feature Reuse
par: Yu, Zichao, et autres
Publié: (2025)
par: Yu, Zichao, et autres
Publié: (2025)
Distillation Traps and Guards: A Calibration Knob for LLM Distillability
par: Zhan, Weixiao, et autres
Publié: (2026)
par: Zhan, Weixiao, et autres
Publié: (2026)
Graph-Augmented Reasoning: Evolving Step-by-Step Knowledge Graph Retrieval for LLM Reasoning
par: Wu, Wenjie, et autres
Publié: (2025)
par: Wu, Wenjie, et autres
Publié: (2025)
VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference Acceleration
par: Tu, Dezhan, et autres
Publié: (2024)
par: Tu, Dezhan, et autres
Publié: (2024)
PruneHal: Reducing Hallucinations in Multi-modal Large Language Models through Adaptive KV Cache Pruning
par: Sun, Fengyuan, et autres
Publié: (2025)
par: Sun, Fengyuan, et autres
Publié: (2025)
CacheQuant: Comprehensively Accelerated Diffusion Models
par: Liu, Xuewen, et autres
Publié: (2025)
par: Liu, Xuewen, et autres
Publié: (2025)
Benchmarking Reasoning Robustness in Large Language Models
par: Yu, Tong, et autres
Publié: (2025)
par: Yu, Tong, et autres
Publié: (2025)
ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification
par: He, Yefei, et autres
Publié: (2024)
par: He, Yefei, et autres
Publié: (2024)
CoVeR: Conformal Calibration for Versatile and Reliable Autoregressive Next-Token Prediction
par: Chen, Yuzhu, et autres
Publié: (2025)
par: Chen, Yuzhu, et autres
Publié: (2025)
AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models
par: Gu, Yifeng, et autres
Publié: (2025)
par: Gu, Yifeng, et autres
Publié: (2025)
Dynamic Parallel Tree Search for Efficient LLM Reasoning
par: Ding, Yifu, et autres
Publié: (2025)
par: Ding, Yifu, et autres
Publié: (2025)
AdaptCache: KV Cache Native Storage Hierarchy for Low-Delay and High-Quality Language Model Serving
par: Feng, Shaoting, et autres
Publié: (2025)
par: Feng, Shaoting, et autres
Publié: (2025)
AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers
par: Liu, Dong, et autres
Publié: (2026)
par: Liu, Dong, et autres
Publié: (2026)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
par: Shi, Dachuan, et autres
Publié: (2025)
par: Shi, Dachuan, et autres
Publié: (2025)
CacheFormer: High Attention-Based Segment Caching
par: Singh, Sushant, et autres
Publié: (2025)
par: Singh, Sushant, et autres
Publié: (2025)
SmallKV: Small Model Assisted Compensation of KV Cache Compression for Efficient LLM Inference
par: Zhao, Yi, et autres
Publié: (2025)
par: Zhao, Yi, et autres
Publié: (2025)
Rethinking Key-Value Cache Compression Techniques for Large Language Model Serving
par: Gao, Wei, et autres
Publié: (2025)
par: Gao, Wei, et autres
Publié: (2025)
Enhancing Large Multimodal Models with Adaptive Sparsity and KV Cache Compression
par: Zhang, Te, et autres
Publié: (2025)
par: Zhang, Te, et autres
Publié: (2025)
KVCache Cache in the Wild: Characterizing and Optimizing KVCache Cache at a Large Cloud Provider
par: Wang, Jiahao, et autres
Publié: (2025)
par: Wang, Jiahao, et autres
Publié: (2025)
ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing
par: Chen, Kaiwen, et autres
Publié: (2025)
par: Chen, Kaiwen, et autres
Publié: (2025)
H2-Cache: A Novel Hierarchical Dual-Stage Cache for High-Performance Acceleration of Generative Diffusion Models
par: Sung, Mingyu, et autres
Publié: (2025)
par: Sung, Mingyu, et autres
Publié: (2025)
TrimCaching: Parameter-sharing AI Model Caching in Wireless Edge Networks
par: Qu, Guanqiao, et autres
Publié: (2024)
par: Qu, Guanqiao, et autres
Publié: (2024)
LLM-Empowered Cooperative Content Caching in Vehicular Fog Caching-Assisted Platoon Networks
par: Tan, Bowen, et autres
Publié: (2026)
par: Tan, Bowen, et autres
Publié: (2026)
CacheClip: Accelerating RAG with Effective KV Cache Reuse
par: Yang, Bin, et autres
Publié: (2025)
par: Yang, Bin, et autres
Publié: (2025)
TableCache: Primary Foreign Key Guided KV Cache Precomputation for Low Latency Text-to-SQL
par: Su, Jinbo, et autres
Publié: (2026)
par: Su, Jinbo, et autres
Publié: (2026)
Adaptive KV-Cache Compression without Manually Setting Budget
par: Tang, Chenxia, et autres
Publié: (2025)
par: Tang, Chenxia, et autres
Publié: (2025)
Rethinking Token-wise Feature Caching: Accelerating Diffusion Transformers with Dual Feature Caching
par: Zou, Chang, et autres
Publié: (2024)
par: Zou, Chang, et autres
Publié: (2024)
SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model
par: Zhang, Yongting, et autres
Publié: (2024)
par: Zhang, Yongting, et autres
Publié: (2024)
OmniCache: A Trajectory-Oriented Global Perspective on Training-Free Cache Reuse for Diffusion Transformer Models
par: Chu, Huanpeng, et autres
Publié: (2025)
par: Chu, Huanpeng, et autres
Publié: (2025)
KVSculpt: KV Cache Compression as Distillation
par: Jiang, Bo, et autres
Publié: (2026)
par: Jiang, Bo, et autres
Publié: (2026)
Documents similaires
-
Diffusion Model-Based Video Editing: A Survey
par: Sun, Wenhao, et autres
Publié: (2024) -
Lightning Fast Caching-based Parallel Denoising Prediction for Accelerating Talking Head Generation
par: Long, Jianzhi, et autres
Publié: (2025) -
dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching
par: Liu, Zhiyuan, et autres
Publié: (2025) -
VORTA: Efficient Video Diffusion via Routing Sparse Attention
par: Sun, Wenhao, et autres
Publié: (2025) -
AsymRnR: Video Diffusion Transformers Acceleration with Asymmetric Reduction and Restoration
par: Sun, Wenhao, et autres
Publié: (2024)