Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding
Fuente:
arXiv
Saved in:
| Main Authors: | Xia, Heming, Yang, Zhe, Dong, Qingxiu, Wang, Peiyi, Li, Yongqi, Ge, Tao, Liu, Tianyu, Li, Wenjie, Sui, Zhifang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Tutorial Proposal: Speculative Decoding for Efficient LLM Inference
by: Xia, Heming, et al.
Published: (2025)
by: Xia, Heming, et al.
Published: (2025)
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
by: Xia, Heming, et al.
Published: (2024)
by: Xia, Heming, et al.
Published: (2024)
Can Large Multimodal Models Uncover Deep Semantics Behind Images?
by: Yang, Yixin, et al.
Published: (2024)
by: Yang, Yixin, et al.
Published: (2024)
How Far are LLMs from Being Our Digital Twins? A Benchmark for Persona-Based Behavior Chain Simulation
by: Li, Rui, et al.
Published: (2025)
by: Li, Rui, et al.
Published: (2025)
ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding
by: Xia, Heming, et al.
Published: (2026)
by: Xia, Heming, et al.
Published: (2026)
Towards Harmonized Uncertainty Estimation for Large Language Models
by: Li, Rui, et al.
Published: (2025)
by: Li, Rui, et al.
Published: (2025)
Self-Boosting Large Language Models with Synthetic Preference Data
by: Dong, Qingxiu, et al.
Published: (2024)
by: Dong, Qingxiu, et al.
Published: (2024)
Enhancing Tool Retrieval with Iterative Feedback from Large Language Models
by: Xu, Qiancheng, et al.
Published: (2024)
by: Xu, Qiancheng, et al.
Published: (2024)
Not All Demonstration Examples are Equally Beneficial: Reweighting Demonstration Examples for In-Context Learning
by: Yang, Zhe, et al.
Published: (2023)
by: Yang, Zhe, et al.
Published: (2023)
Decoding in Geometry: Alleviating Embedding-Space Crowding for Complex Reasoning
by: Yang, Yixin, et al.
Published: (2026)
by: Yang, Yixin, et al.
Published: (2026)
PEToolLLM: Towards Personalized Tool Learning in Large Language Models
by: Xu, Qiancheng, et al.
Published: (2025)
by: Xu, Qiancheng, et al.
Published: (2025)
A Survey on In-context Learning
by: Dong, Qingxiu, et al.
Published: (2022)
by: Dong, Qingxiu, et al.
Published: (2022)
Taking a Deep Breath: Enhancing Language Modeling of Large Language Models with Sentinel Tokens
by: Luo, Weiyao, et al.
Published: (2024)
by: Luo, Weiyao, et al.
Published: (2024)
RICo: Refined In-Context Contribution for Automatic Instruction-Tuning Data Selection
by: Yang, Yixin, et al.
Published: (2025)
by: Yang, Yixin, et al.
Published: (2025)
PeriodicLoRA: Breaking the Low-Rank Bottleneck in LoRA Optimization
by: Meng, Xiangdi, et al.
Published: (2024)
by: Meng, Xiangdi, et al.
Published: (2024)
Beyond Single Frames: Can LMMs Comprehend Temporal and Contextual Narratives in Image Sequences?
by: Wang, Xiaochen, et al.
Published: (2025)
by: Wang, Xiaochen, et al.
Published: (2025)
Reducing Hallucinations in Entity Abstract Summarization with Facts-Template Decomposition
by: Zhu, Fangwei, et al.
Published: (2024)
by: Zhu, Fangwei, et al.
Published: (2024)
Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
by: Xia, Heming, et al.
Published: (2025)
by: Xia, Heming, et al.
Published: (2025)
KNN-SSD: Enabling Dynamic Self-Speculative Decoding via Nearest Neighbor Layer Set Optimization
by: Song, Mingbo, et al.
Published: (2025)
by: Song, Mingbo, et al.
Published: (2025)
Chain-of-Thought Tokens are Computer Program Variables
by: Zhu, Fangwei, et al.
Published: (2025)
by: Zhu, Fangwei, et al.
Published: (2025)
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
by: Xia, Heming, et al.
Published: (2025)
by: Xia, Heming, et al.
Published: (2025)
Towards a Unified View of Preference Learning for Large Language Models: A Survey
by: Gao, Bofei, et al.
Published: (2024)
by: Gao, Bofei, et al.
Published: (2024)
SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoning
by: Li, Zheng, et al.
Published: (2025)
by: Li, Zheng, et al.
Published: (2025)
Reinforcement Pre-Training
by: Dong, Qingxiu, et al.
Published: (2025)
by: Dong, Qingxiu, et al.
Published: (2025)
Can Large Language Models Always Solve Easy Problems if They Can Solve Harder Ones?
by: Yang, Zhe, et al.
Published: (2024)
by: Yang, Zhe, et al.
Published: (2024)
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
by: Li, Guanghao, et al.
Published: (2025)
by: Li, Guanghao, et al.
Published: (2025)
Towards Better RL Training Data Utilization via Second-Order Rollout
by: Yang, Zhe, et al.
Published: (2026)
by: Yang, Zhe, et al.
Published: (2026)
Reasoning Beyond Language: A Comprehensive Survey on Latent Chain-of-Thought Reasoning
by: Chen, Xinghao, et al.
Published: (2025)
by: Chen, Xinghao, et al.
Published: (2025)
Speculative Decoding for Multi-Sample Inference
by: Li, Yiwei, et al.
Published: (2025)
by: Li, Yiwei, et al.
Published: (2025)
Be a Multitude to Itself: A Prompt Evolution Framework for Red Teaming
by: Li, Rui, et al.
Published: (2025)
by: Li, Rui, et al.
Published: (2025)
Speculative Decoding and Beyond: An In-Depth Survey of Techniques
by: Hu, Yunhai, et al.
Published: (2025)
by: Hu, Yunhai, et al.
Published: (2025)
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
by: Xiao, Zilin, et al.
Published: (2024)
by: Xiao, Zilin, et al.
Published: (2024)
A Probabilistic Inference Scaling Theory for LLM Self-Correction
by: Yang, Zhe, et al.
Published: (2025)
by: Yang, Zhe, et al.
Published: (2025)
HauntAttack: When Attack Follows Reasoning as a Shadow
by: Ma, Jingyuan, et al.
Published: (2025)
by: Ma, Jingyuan, et al.
Published: (2025)
Dynamic Speculation Lookahead Accelerates Speculative Decoding of Large Language Models
by: Mamou, Jonathan, et al.
Published: (2024)
by: Mamou, Jonathan, et al.
Published: (2024)
A Survey of Generative Search and Recommendation in the Era of Large Language Models
by: Li, Yongqi, et al.
Published: (2024)
by: Li, Yongqi, et al.
Published: (2024)
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
by: Liu, Tianyu, et al.
Published: (2025)
by: Liu, Tianyu, et al.
Published: (2025)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
by: Ji, Yicheng, et al.
Published: (2025)
by: Ji, Yicheng, et al.
Published: (2025)
RAPID: Long-Context Inference with Retrieval-Augmented Speculative Decoding
by: Chen, Guanzheng, et al.
Published: (2025)
by: Chen, Guanzheng, et al.
Published: (2025)
Efficient Inference for Large Language Model-based Generative Recommendation
by: Lin, Xinyu, et al.
Published: (2024)
by: Lin, Xinyu, et al.
Published: (2024)
Similar Items
-
Tutorial Proposal: Speculative Decoding for Efficient LLM Inference
by: Xia, Heming, et al.
Published: (2025) -
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
by: Xia, Heming, et al.
Published: (2024) -
Can Large Multimodal Models Uncover Deep Semantics Behind Images?
by: Yang, Yixin, et al.
Published: (2024) -
How Far are LLMs from Being Our Digital Twins? A Benchmark for Persona-Based Behavior Chain Simulation
by: Li, Rui, et al.
Published: (2025) -
ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding
by: Xia, Heming, et al.
Published: (2026)