SlimInfer: Accelerating Long-Context LLM Inference via Dynamic Token Pruning
Fuente:
arXiv
Guardado en:
| Autores principales: | Long, Lingkun, Yang, Rubing, Huang, Yushi, Hui, Desheng, Zhou, Ao, Yang, Jianlei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
por: Long, Lingkun, et al.
Publicado: (2026)
por: Long, Lingkun, et al.
Publicado: (2026)
LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference
por: Fu, Qichen, et al.
Publicado: (2024)
por: Fu, Qichen, et al.
Publicado: (2024)
RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval
por: Liu, Di, et al.
Publicado: (2024)
por: Liu, Di, et al.
Publicado: (2024)
DASH-KV: Accelerating Long-Context LLM Inference via Asymmetric KV Cache Hashing
por: Guo, Jinyu, et al.
Publicado: (2026)
por: Guo, Jinyu, et al.
Publicado: (2026)
InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference
por: Pan, Xiurui, et al.
Publicado: (2024)
por: Pan, Xiurui, et al.
Publicado: (2024)
APB: Accelerating Distributed Long-Context Inference by Passing Compressed Context Blocks across GPUs
por: Huang, Yuxiang, et al.
Publicado: (2025)
por: Huang, Yuxiang, et al.
Publicado: (2025)
HAMburger: Accelerating LLM Inference via Token Smashing
por: Liu, Jingyu, et al.
Publicado: (2025)
por: Liu, Jingyu, et al.
Publicado: (2025)
Squeezed Attention: Accelerating Long Context Length LLM Inference
por: Hooper, Coleman, et al.
Publicado: (2024)
por: Hooper, Coleman, et al.
Publicado: (2024)
HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
por: Duan, Cenlin, et al.
Publicado: (2025)
por: Duan, Cenlin, et al.
Publicado: (2025)
ProPD: Dynamic Token Tree Pruning and Generation for LLM Parallel Decoding
por: Zhong, Shuzhang, et al.
Publicado: (2024)
por: Zhong, Shuzhang, et al.
Publicado: (2024)
LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language Model
por: Shao, Wei, et al.
Publicado: (2025)
por: Shao, Wei, et al.
Publicado: (2025)
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
por: Dehghanighobadi, Zahra, et al.
Publicado: (2026)
por: Dehghanighobadi, Zahra, et al.
Publicado: (2026)
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
por: Gu, Yuzhe, et al.
Publicado: (2025)
por: Gu, Yuzhe, et al.
Publicado: (2025)
TokenSelect: Efficient Long-Context Inference and Length Extrapolation for LLMs via Dynamic Token-Level KV Cache Selection
por: Wu, Wei, et al.
Publicado: (2024)
por: Wu, Wei, et al.
Publicado: (2024)
Fewer is More: Boosting LLM Reasoning with Reinforced Context Pruning
por: Huang, Xijie, et al.
Publicado: (2023)
por: Huang, Xijie, et al.
Publicado: (2023)
LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens
por: Ding, Yiran, et al.
Publicado: (2024)
por: Ding, Yiran, et al.
Publicado: (2024)
LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding
por: Lin, Gang, et al.
Publicado: (2026)
por: Lin, Gang, et al.
Publicado: (2026)
DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration
por: Zhang, Hanzhi, et al.
Publicado: (2025)
por: Zhang, Hanzhi, et al.
Publicado: (2025)
Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs
por: Synk, Ryan, et al.
Publicado: (2025)
por: Synk, Ryan, et al.
Publicado: (2025)
Probe and Skip: Self-Predictive Token Skipping for Efficient Long-Context LLM Inference
por: Wu, Zimeng, et al.
Publicado: (2026)
por: Wu, Zimeng, et al.
Publicado: (2026)
AdaSkip: Adaptive Sublayer Skipping for Accelerating Long-Context LLM Inference
por: He, Zhuomin, et al.
Publicado: (2025)
por: He, Zhuomin, et al.
Publicado: (2025)
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
por: Behnam, Payman, et al.
Publicado: (2025)
por: Behnam, Payman, et al.
Publicado: (2025)
PipeInfer: Accelerating LLM Inference using Asynchronous Pipelined Speculation
por: Butler, Branden, et al.
Publicado: (2024)
por: Butler, Branden, et al.
Publicado: (2024)
Efficient Long-Context LLM Inference via KV Cache Clustering
por: Hu, Jie, et al.
Publicado: (2025)
por: Hu, Jie, et al.
Publicado: (2025)
RRAttention: Dynamic Block Sparse Attention via Per-Head Round-Robin Shifts for Long-Context Inference
por: Liu, Siran, et al.
Publicado: (2026)
por: Liu, Siran, et al.
Publicado: (2026)
Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection
por: Jo, Dongwon, et al.
Publicado: (2026)
por: Jo, Dongwon, et al.
Publicado: (2026)
Probe Pruning: Accelerating LLMs through Dynamic Pruning via Model-Probing
por: Le, Qi, et al.
Publicado: (2025)
por: Le, Qi, et al.
Publicado: (2025)
Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
por: Taniguchi, Rei, et al.
Publicado: (2026)
por: Taniguchi, Rei, et al.
Publicado: (2026)
UniPrefill: Universal Long-Context Prefill Acceleration via Block-wise Dynamic Sparsification
por: Fan, Qihang, et al.
Publicado: (2026)
por: Fan, Qihang, et al.
Publicado: (2026)
SampleAttention: Near-Lossless Acceleration of Long Context LLM Inference with Adaptive Structured Sparse Attention
por: Zhu, Qianchao, et al.
Publicado: (2024)
por: Zhu, Qianchao, et al.
Publicado: (2024)
DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads
por: Xiao, Guangxuan, et al.
Publicado: (2024)
por: Xiao, Guangxuan, et al.
Publicado: (2024)
PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference
por: Yang, Dongjie, et al.
Publicado: (2024)
por: Yang, Dongjie, et al.
Publicado: (2024)
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
por: Dzikanyanga, Gradwell, et al.
Publicado: (2026)
por: Dzikanyanga, Gradwell, et al.
Publicado: (2026)
MEDA: Dynamic KV Cache Allocation for Efficient Multimodal Long-Context Inference
por: Wan, Zhongwei, et al.
Publicado: (2025)
por: Wan, Zhongwei, et al.
Publicado: (2025)
VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization
por: Yao, Dingyu, et al.
Publicado: (2025)
por: Yao, Dingyu, et al.
Publicado: (2025)
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
por: Liu, Chengbo, et al.
Publicado: (2024)
por: Liu, Chengbo, et al.
Publicado: (2024)
DYCP: Dynamic Context Pruning for Long-Form Dialogue with LLMs
por: Choi, Nayoung, et al.
Publicado: (2026)
por: Choi, Nayoung, et al.
Publicado: (2026)
SparseAccelerate: Efficient Long-Context Inference for Mid-Range GPUs
por: Vo, James
Publicado: (2024)
por: Vo, James
Publicado: (2024)
CATP: Cross-Attention Token Pruning for Accuracy Preserved Multimodal Model Inference
por: Liao, Ruqi, et al.
Publicado: (2024)
por: Liao, Ruqi, et al.
Publicado: (2024)
Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM Inference
por: Huang, Jianuo, et al.
Publicado: (2025)
por: Huang, Jianuo, et al.
Publicado: (2025)
Ejemplares similares
-
Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
por: Long, Lingkun, et al.
Publicado: (2026) -
LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference
por: Fu, Qichen, et al.
Publicado: (2024) -
RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval
por: Liu, Di, et al.
Publicado: (2024) -
DASH-KV: Accelerating Long-Context LLM Inference via Asymmetric KV Cache Hashing
por: Guo, Jinyu, et al.
Publicado: (2026) -
InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference
por: Pan, Xiurui, et al.
Publicado: (2024)