SDFP: Speculative Decoding with FIT-Pruned Models for Training-Free and Plug-and-Play LLM Acceleration
Fuente:
arXiv
Salvato in:
| Autori principali: | Wei, Hanyu, Su, Zunhai, Lu, Peng, Li, Chao, Tiwari, Spandan, Sirasao, Ashish, Dong, Yuhan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dual LoRA: Enhancing LoRA with Magnitude and Direction Updates
di: Xu, Yixing, et al.
Pubblicazione: (2025)
di: Xu, Yixing, et al.
Pubblicazione: (2025)
Forecasting LLM Inference Performance via Hardware-Agnostic Analytical Modeling
di: Patwari, Rajeev, et al.
Pubblicazione: (2025)
di: Patwari, Rajeev, et al.
Pubblicazione: (2025)
Recover-LoRA: Data-Free Accuracy Recovery of Degraded Language Models via Low-Rank Adaptation
di: Das, Devleena, et al.
Pubblicazione: (2025)
di: Das, Devleena, et al.
Pubblicazione: (2025)
NGM: A Plug-and-Play Training-Free Memory Module for LLMs
di: Qu, Yuwen, et al.
Pubblicazione: (2026)
di: Qu, Yuwen, et al.
Pubblicazione: (2026)
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
di: Wang, Pei-Shuo, et al.
Pubblicazione: (2025)
di: Wang, Pei-Shuo, et al.
Pubblicazione: (2025)
Speculative Coupled Decoding for Training-Free Lossless Acceleration of Autoregressive Visual Generation
di: So, Junhyuk, et al.
Pubblicazione: (2025)
di: So, Junhyuk, et al.
Pubblicazione: (2025)
Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding
di: Jin, Tao, et al.
Pubblicazione: (2026)
di: Jin, Tao, et al.
Pubblicazione: (2026)
HSD: Training-Free Acceleration for Document Parsing Vision-Language Model with Hierarchical Speculative Decoding
di: Liao, Wenhui, et al.
Pubblicazione: (2026)
di: Liao, Wenhui, et al.
Pubblicazione: (2026)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
di: Xiong, Minhao, et al.
Pubblicazione: (2025)
di: Xiong, Minhao, et al.
Pubblicazione: (2025)
Enhancing One-shot Pruned Pre-trained Language Models through Sparse-Dense-Sparse Mechanism
di: Li, Guanchen, et al.
Pubblicazione: (2024)
di: Li, Guanchen, et al.
Pubblicazione: (2024)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
di: Wen, Zhuofan, et al.
Pubblicazione: (2024)
di: Wen, Zhuofan, et al.
Pubblicazione: (2024)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
Plug-and-Play AMC: Context Is King in Training-Free, Open-Set Modulation with LLMs
di: Rostami, Mohammad, et al.
Pubblicazione: (2025)
di: Rostami, Mohammad, et al.
Pubblicazione: (2025)
Accelerating Cross‐Scenario Metasurface Adaptability with Plug‐and‐Play Kernel
di: Nanxuan Wu, et al.
Pubblicazione: (2025)
di: Nanxuan Wu, et al.
Pubblicazione: (2025)
Memory Decoder: A Pretrained, Plug-and-Play Memory for Large Language Models
di: Cao, Jiaqi, et al.
Pubblicazione: (2025)
di: Cao, Jiaqi, et al.
Pubblicazione: (2025)
Towards Extreme Pruning of LLMs with Plug-and-Play Mixed Sparsity
di: Xu, Chi, et al.
Pubblicazione: (2025)
di: Xu, Chi, et al.
Pubblicazione: (2025)
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
di: Xia, Heming, et al.
Pubblicazione: (2024)
di: Xia, Heming, et al.
Pubblicazione: (2024)
AMUSD: Asynchronous Multi-Device Speculative Decoding for LLM Acceleration
di: McDanel, Bradley
Pubblicazione: (2024)
di: McDanel, Bradley
Pubblicazione: (2024)
Dynamic Speculation Lookahead Accelerates Speculative Decoding of Large Language Models
di: Mamou, Jonathan, et al.
Pubblicazione: (2024)
di: Mamou, Jonathan, et al.
Pubblicazione: (2024)
An Interpretable Latency Model for Speculative Decoding in LLM Serving
di: Kong, Linghao, et al.
Pubblicazione: (2026)
di: Kong, Linghao, et al.
Pubblicazione: (2026)
PlugSelect: Pruning Channels with Plug-and-Play Flexibility for Electroencephalography-based Brain Computer Interface
di: Yuan, Xue, et al.
Pubblicazione: (2025)
di: Yuan, Xue, et al.
Pubblicazione: (2025)
LymphNode: A Plug-and-Play Access Control Method for Deep Neural Networks
di: Pei, Hanyu, et al.
Pubblicazione: (2026)
di: Pei, Hanyu, et al.
Pubblicazione: (2026)
KVSink: Understanding and Enhancing the Preservation of Attention Sinks in KV Cache Quantization for LLMs
di: Su, Zunhai, et al.
Pubblicazione: (2025)
di: Su, Zunhai, et al.
Pubblicazione: (2025)
FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models
di: Li, Senmao, et al.
Pubblicazione: (2025)
di: Li, Senmao, et al.
Pubblicazione: (2025)
Efficiency Unleashed: Inference Acceleration for LLM-based Recommender Systems with Speculative Decoding
di: Xi, Yunjia, et al.
Pubblicazione: (2024)
di: Xi, Yunjia, et al.
Pubblicazione: (2024)
SAT: Sequential Agent Tuning for Coordinator Free Plug and Play Multi-LLM Training with Monotonic Improvement Guarantees
di: Xie, Yi, et al.
Pubblicazione: (2026)
di: Xie, Yi, et al.
Pubblicazione: (2026)
SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning
di: Wang, Hanzhen, et al.
Pubblicazione: (2025)
di: Wang, Hanzhen, et al.
Pubblicazione: (2025)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
di: Wei, Linye, et al.
Pubblicazione: (2025)
di: Wei, Linye, et al.
Pubblicazione: (2025)
AKVQ-VL: Attention-Aware KV Cache Adaptive 2-Bit Quantization for Vision-Language Models
di: Su, Zunhai, et al.
Pubblicazione: (2025)
di: Su, Zunhai, et al.
Pubblicazione: (2025)
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2025)
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2025)
Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous Vocabularies
di: Timor, Nadav, et al.
Pubblicazione: (2025)
di: Timor, Nadav, et al.
Pubblicazione: (2025)
Plug-and-Play Homeostatic Spark: Zero-Cost Acceleration for SNN Training Across Paradigms
di: Chen, Rui, et al.
Pubblicazione: (2025)
di: Chen, Rui, et al.
Pubblicazione: (2025)
Block Verification Accelerates Speculative Decoding
di: Sun, Ziteng, et al.
Pubblicazione: (2024)
di: Sun, Ziteng, et al.
Pubblicazione: (2024)
Accelerating Time Series Foundation Models with Speculative Decoding
di: Subbaraman, Pranav, et al.
Pubblicazione: (2025)
di: Subbaraman, Pranav, et al.
Pubblicazione: (2025)
Entropy-Aware Speculative Decoding Toward Improved LLM Reasoning
di: Su, Tiancheng, et al.
Pubblicazione: (2025)
di: Su, Tiancheng, et al.
Pubblicazione: (2025)
Plug-and-Play Training Framework for Preference Optimization
di: Ma, Jingyuan, et al.
Pubblicazione: (2024)
di: Ma, Jingyuan, et al.
Pubblicazione: (2024)
Variator: Accelerating Pre-trained Models with Plug-and-Play Compression Modules
di: Xiao, Chaojun, et al.
Pubblicazione: (2023)
di: Xiao, Chaojun, et al.
Pubblicazione: (2023)
Towards Scale-Aware Full Surround Monodepth with Transformers
di: Yang, Yuchen, et al.
Pubblicazione: (2024)
di: Yang, Yuchen, et al.
Pubblicazione: (2024)
RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use
di: Chai, Jiajun, et al.
Pubblicazione: (2025)
di: Chai, Jiajun, et al.
Pubblicazione: (2025)
Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding
di: Iso, Hayate, et al.
Pubblicazione: (2026)
di: Iso, Hayate, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Dual LoRA: Enhancing LoRA with Magnitude and Direction Updates
di: Xu, Yixing, et al.
Pubblicazione: (2025) -
Forecasting LLM Inference Performance via Hardware-Agnostic Analytical Modeling
di: Patwari, Rajeev, et al.
Pubblicazione: (2025) -
Recover-LoRA: Data-Free Accuracy Recovery of Degraded Language Models via Low-Rank Adaptation
di: Das, Devleena, et al.
Pubblicazione: (2025) -
NGM: A Plug-and-Play Training-Free Memory Module for LLMs
di: Qu, Yuwen, et al.
Pubblicazione: (2026) -
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
di: Wang, Pei-Shuo, et al.
Pubblicazione: (2025)