PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Hao, Lyu, Mengsi, Chen, Zhuo, Xing, Xingrun, Ao, Yulong, Lin, Yonghua |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
POP: Prefill-Only Pruning for Efficient Large Model Inference
par: He, Junhui, et autres
Publié: (2026)
par: He, Junhui, et autres
Publié: (2026)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference
par: Tang, Xiaojuan, et autres
Publié: (2025)
par: Tang, Xiaojuan, et autres
Publié: (2025)
KLoB: a Benchmark for Assessing Knowledge Locating Methods in Language Models
par: Ju, Yiming, et autres
Publié: (2023)
par: Ju, Yiming, et autres
Publié: (2023)
Copy-as-Decode: Grammar-Constrained Parallel Prefill for LLM Editing
par: Liu, Ziyang
Publié: (2026)
par: Liu, Ziyang
Publié: (2026)
FlashPrefill: Instantaneous Pattern Discovery and Thresholding for Ultra-Fast Long-Context Prefilling
par: Fan, Qihang, et autres
Publié: (2026)
par: Fan, Qihang, et autres
Publié: (2026)
CATP: Cross-Attention Token Pruning for Accuracy Preserved Multimodal Model Inference
par: Liao, Ruqi, et autres
Publié: (2024)
par: Liao, Ruqi, et autres
Publié: (2024)
Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation
par: Liu, Jingyu, et autres
Publié: (2025)
par: Liu, Jingyu, et autres
Publié: (2025)
LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding
par: Lin, Gang, et autres
Publié: (2026)
par: Lin, Gang, et autres
Publié: (2026)
PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning
par: Zhang, Luan, et autres
Publié: (2026)
par: Zhang, Luan, et autres
Publié: (2026)
PruneCD: Contrasting Pruned Self Model to Improve Decoding Factuality
par: Yu, Byeongho, et autres
Publié: (2025)
par: Yu, Byeongho, et autres
Publié: (2025)
InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation
par: Wan, Yixin, et autres
Publié: (2025)
par: Wan, Yixin, et autres
Publié: (2025)
SwiftKV: Fast Prefill-Optimized Inference with Knowledge-Preserving Model Transformation
par: Qiao, Aurick, et autres
Publié: (2024)
par: Qiao, Aurick, et autres
Publié: (2024)
Plato: Plan to Efficiently Decode for Large Language Model Inference
par: Jin, Shuowei, et autres
Publié: (2024)
par: Jin, Shuowei, et autres
Publié: (2024)
CritiPrefill: A Segment-wise Criticality-based Approach for Prefilling Acceleration in LLMs
par: Lv, Junlin, et autres
Publié: (2024)
par: Lv, Junlin, et autres
Publié: (2024)
Block-Attention for Efficient Prefilling
par: Ma, Dongyang, et autres
Publié: (2024)
par: Ma, Dongyang, et autres
Publié: (2024)
FlowKV: A Disaggregated Inference Framework with Low-Latency KV Cache Transfer and Load-Aware Scheduling
par: Li, Weiqing, et autres
Publié: (2025)
par: Li, Weiqing, et autres
Publié: (2025)
Speculative Decoding for Multi-Sample Inference
par: Li, Yiwei, et autres
Publié: (2025)
par: Li, Yiwei, et autres
Publié: (2025)
DeFT: Decoding with Flash Tree-attention for Efficient Tree-structured LLM Inference
par: Yao, Jinwei, et autres
Publié: (2024)
par: Yao, Jinwei, et autres
Publié: (2024)
EvoP: Robust LLM Inference via Evolutionary Pruning
par: Wu, Shangyu, et autres
Publié: (2025)
par: Wu, Shangyu, et autres
Publié: (2025)
ALPS: Attention Localization and Pruning Strategy for Efficient Alignment of Large Language Models
par: Chen, Hao, et autres
Publié: (2025)
par: Chen, Hao, et autres
Publié: (2025)
On the Limitations of Language Targeted Pruning: Investigating the Calibration Language Impact in Multilingual LLM Pruning
par: Kurz, Simon, et autres
Publié: (2024)
par: Kurz, Simon, et autres
Publié: (2024)
Mitigating Training Imbalance in LLM Fine-Tuning via Selective Parameter Merging
par: Ju, Yiming, et autres
Publié: (2024)
par: Ju, Yiming, et autres
Publié: (2024)
LeanK: Learnable K Cache Channel Pruning for Efficient Decoding
par: Zhang, Yike, et autres
Publié: (2025)
par: Zhang, Yike, et autres
Publié: (2025)
Aqulia-Med LLM: Pioneering Full-Process Open-Source Medical Language Models
par: Zhao, Lulu, et autres
Publié: (2024)
par: Zhao, Lulu, et autres
Publié: (2024)
Earley-Driven Dynamic Pruning for Efficient Structured Decoding
par: Sun, Xintong, et autres
Publié: (2025)
par: Sun, Xintong, et autres
Publié: (2025)
CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference
par: Liu, Dong, et autres
Publié: (2025)
par: Liu, Dong, et autres
Publié: (2025)
From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities
par: Zhang, Wanpeng, et autres
Publié: (2024)
par: Zhang, Wanpeng, et autres
Publié: (2024)
Decoding at the Speed of Thought: Harnessing Parallel Decoding of Lexical Units for LLMs
par: Sun, Chenxi, et autres
Publié: (2024)
par: Sun, Chenxi, et autres
Publié: (2024)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
par: Ji, Yicheng, et autres
Publié: (2025)
par: Ji, Yicheng, et autres
Publié: (2025)
Towards Threshold-Free KV Cache Pruning
par: Ni, Xuanfan, et autres
Publié: (2025)
par: Ni, Xuanfan, et autres
Publié: (2025)
RASD: Retrieval-Augmented Speculative Decoding
par: Quan, Guofeng, et autres
Publié: (2025)
par: Quan, Guofeng, et autres
Publié: (2025)
LiveMind: Low-latency Large Language Models with Simultaneous Inference
par: Chen, Chuangtao, et autres
Publié: (2024)
par: Chen, Chuangtao, et autres
Publié: (2024)
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
par: Gu, Yuzhe, et autres
Publié: (2025)
par: Gu, Yuzhe, et autres
Publié: (2025)
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
par: Dehghanighobadi, Zahra, et autres
Publié: (2026)
par: Dehghanighobadi, Zahra, et autres
Publié: (2026)
Let's Put Ourselves in Sally's Shoes: Shoes-of-Others Prefilling Improves Theory of Mind in Large Language Models
par: Shinoda, Kazutoshi, et autres
Publié: (2025)
par: Shinoda, Kazutoshi, et autres
Publié: (2025)
Accelerating Prefilling for Long-Context LLMs via Sparse Pattern Sharing
par: Peng, Dan, et autres
Publié: (2025)
par: Peng, Dan, et autres
Publié: (2025)
Prefill-Guided Thinking for zero-shot detection of AI-generated images
par: Kachwala, Zoher, et autres
Publié: (2025)
par: Kachwala, Zoher, et autres
Publié: (2025)
MedREK: Retrieval-Based Editing for Medical LLMs with Key-Aware Prompts
par: Xia, Shujun, et autres
Publié: (2025)
par: Xia, Shujun, et autres
Publié: (2025)
Documents similaires
-
POP: Prefill-Only Pruning for Efficient Large Model Inference
par: He, Junhui, et autres
Publié: (2026) -
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
par: Zhang, Hao, et autres
Publié: (2025) -
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
par: Zhang, Hao, et autres
Publié: (2025) -
TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference
par: Tang, Xiaojuan, et autres
Publié: (2025) -
KLoB: a Benchmark for Assessing Knowledge Locating Methods in Language Models
par: Ju, Yiming, et autres
Publié: (2023)