Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Xuwen, Liu, Fangxin, Wang, Chao, Zheng, Xiao, Zheng, Hao, He, Min, Jiang, Li, Guan, Haibing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DASH: Input-Aware Dynamic Layer Skipping for Efficient LLM Inference with Markov Decision Policies
par: Yang, Ning, et autres
Publié: (2025)
par: Yang, Ning, et autres
Publié: (2025)
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
par: Xiao, Zilin, et autres
Publié: (2024)
par: Xiao, Zilin, et autres
Publié: (2024)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
par: Goel, Raghavv, et autres
Publié: (2025)
par: Goel, Raghavv, et autres
Publié: (2025)
Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding
par: Xiao, Bin, et autres
Publié: (2024)
par: Xiao, Bin, et autres
Publié: (2024)
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
par: Hu, Yuezhou, et autres
Publié: (2025)
par: Hu, Yuezhou, et autres
Publié: (2025)
Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding
par: Ryu, Hyun, et autres
Publié: (2024)
par: Ryu, Hyun, et autres
Publié: (2024)
Yggdrasil: Bridging Dynamic Speculation and Static Runtime for Latency-Optimal Tree-Based LLM Decoding
par: Guan, Yue, et autres
Publié: (2025)
par: Guan, Yue, et autres
Publié: (2025)
Decoding Speculative Decoding
par: Yan, Minghao, et autres
Publié: (2024)
par: Yan, Minghao, et autres
Publié: (2024)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
par: Huang, Kaixuan, et autres
Publié: (2024)
par: Huang, Kaixuan, et autres
Publié: (2024)
Online Speculative Decoding
par: Liu, Xiaoxuan, et autres
Publié: (2023)
par: Liu, Xiaoxuan, et autres
Publié: (2023)
Scaling Speculative Decoding with Lookahead Reasoning
par: Fu, Yichao, et autres
Publié: (2025)
par: Fu, Yichao, et autres
Publié: (2025)
DEL: Context-Aware Dynamic Exit Layer for Efficient Self-Speculative Decoding
par: Zarch, Hossein Entezari, et autres
Publié: (2025)
par: Zarch, Hossein Entezari, et autres
Publié: (2025)
Token-Driven GammaTune: Adaptive Calibration for Enhanced Speculative Decoding
par: Gautam, Aayush, et autres
Publié: (2025)
par: Gautam, Aayush, et autres
Publié: (2025)
Traversal Verification for Speculative Tree Decoding
par: Weng, Yepeng, et autres
Publié: (2025)
par: Weng, Yepeng, et autres
Publié: (2025)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
par: Yang, Penghui, et autres
Publié: (2025)
par: Yang, Penghui, et autres
Publié: (2025)
Speculative Decoding Across Languages
par: Paudel, Nirajan, et autres
Publié: (2026)
par: Paudel, Nirajan, et autres
Publié: (2026)
Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding
par: Sun, Shuoyang, et autres
Publié: (2026)
par: Sun, Shuoyang, et autres
Publié: (2026)
PRISM: Parametrically Refactoring Inference for Speculative Sampling Draft Models
par: Wang, Xuliang, et autres
Publié: (2026)
par: Wang, Xuliang, et autres
Publié: (2026)
LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
par: Elhoushi, Mostafa, et autres
Publié: (2024)
par: Elhoushi, Mostafa, et autres
Publié: (2024)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
par: Wen, Zhuofan, et autres
Publié: (2024)
par: Wen, Zhuofan, et autres
Publié: (2024)
Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous Vocabularies
par: Timor, Nadav, et autres
Publié: (2025)
par: Timor, Nadav, et autres
Publié: (2025)
REST: Retrieval-Based Speculative Decoding
par: He, Zhenyu, et autres
Publié: (2023)
par: He, Zhenyu, et autres
Publié: (2023)
Progressive Mixed-Precision Decoding for Efficient LLM Inference
par: Chen, Hao Mark, et autres
Publié: (2024)
par: Chen, Hao Mark, et autres
Publié: (2024)
Speculative Decoding for Verilog: Speed and Quality, All in One
par: Xu, Changran, et autres
Publié: (2025)
par: Xu, Changran, et autres
Publié: (2025)
Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency
par: Li, Ruixiao, et autres
Publié: (2025)
par: Li, Ruixiao, et autres
Publié: (2025)
Boosting Lossless Speculative Decoding via Feature Sampling and Partial Alignment Distillation
par: Gui, Lujun, et autres
Publié: (2024)
par: Gui, Lujun, et autres
Publié: (2024)
Out-of-Vocabulary Sampling Boosts Speculative Decoding
par: Timor, Nadav, et autres
Publié: (2025)
par: Timor, Nadav, et autres
Publié: (2025)
Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting
par: Liu, Fangcheng, et autres
Publié: (2024)
par: Liu, Fangcheng, et autres
Publié: (2024)
Mixture of Attentions For Speculative Decoding
par: Zimmer, Matthieu, et autres
Publié: (2024)
par: Zimmer, Matthieu, et autres
Publié: (2024)
EAGLE-Pangu: Accelerator-Safe Tree Speculative Decoding on Ascend NPUs
par: Han, Chang, et autres
Publié: (2026)
par: Han, Chang, et autres
Publié: (2026)
SpecForge: A Flexible and Efficient Open-Source Training Framework for Speculative Decoding
par: Li, Shenggui, et autres
Publié: (2026)
par: Li, Shenggui, et autres
Publié: (2026)
Clover: Regressive Lightweight Speculative Decoding with Sequential Knowledge
par: Xiao, Bin, et autres
Publié: (2024)
par: Xiao, Bin, et autres
Publié: (2024)
Decoder-Hybrid-Decoder Architecture for Efficient Reasoning with Long Generation
par: Ren, Liliang, et autres
Publié: (2025)
par: Ren, Liliang, et autres
Publié: (2025)
Fast Large Language Model Collaborative Decoding via Speculation
par: Fu, Jiale, et autres
Publié: (2025)
par: Fu, Jiale, et autres
Publié: (2025)
Faster Cascades via Speculative Decoding
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
Polybasic Speculative Decoding Through a Theoretical Perspective
par: Wang, Ruilin, et autres
Publié: (2025)
par: Wang, Ruilin, et autres
Publié: (2025)
Speculative Diffusion Decoding: Accelerating Language Generation through Diffusion
par: Christopher, Jacob K, et autres
Publié: (2024)
par: Christopher, Jacob K, et autres
Publié: (2024)
LK Losses: Direct Acceptance Rate Optimization for Speculative Decoding
par: Samarin, Alexander, et autres
Publié: (2026)
par: Samarin, Alexander, et autres
Publié: (2026)
Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
par: Ziashahabi, Amir, et autres
Publié: (2025)
par: Ziashahabi, Amir, et autres
Publié: (2025)
Recurrent Drafter for Fast Speculative Decoding in Large Language Models
par: Cheng, Yunfei, et autres
Publié: (2024)
par: Cheng, Yunfei, et autres
Publié: (2024)
Documents similaires
-
DASH: Input-Aware Dynamic Layer Skipping for Efficient LLM Inference with Markov Decision Policies
par: Yang, Ning, et autres
Publié: (2025) -
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
par: Xiao, Zilin, et autres
Publié: (2024) -
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
par: Goel, Raghavv, et autres
Publié: (2025) -
Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding
par: Xiao, Bin, et autres
Publié: (2024) -
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
par: Hu, Yuezhou, et autres
Publié: (2025)