Balancing Coverage and Draft Latency in Vocabulary Trimming for Faster Speculative Decoding
Fuente:
arXiv
Salvato in:
| Autore principale: | Shoham, Ofir Ben |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CPLLM: Clinical Prediction with Large Language Models
di: Shoham, Ofir Ben, et al.
Pubblicazione: (2023)
di: Shoham, Ofir Ben, et al.
Pubblicazione: (2023)
$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts
di: Cemri, Mert, et al.
Pubblicazione: (2025)
di: Cemri, Mert, et al.
Pubblicazione: (2025)
Faster Cascades via Speculative Decoding
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
di: Huang, Langlin, et al.
Pubblicazione: (2025)
di: Huang, Langlin, et al.
Pubblicazione: (2025)
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
di: Wen, Zhuofan, et al.
Pubblicazione: (2024)
di: Wen, Zhuofan, et al.
Pubblicazione: (2024)
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
di: Hong, Fenglu, et al.
Pubblicazione: (2025)
di: Hong, Fenglu, et al.
Pubblicazione: (2025)
Self-Speculative Biased Decoding for Faster Re-Translation
di: Zeng, Linxiao, et al.
Pubblicazione: (2025)
di: Zeng, Linxiao, et al.
Pubblicazione: (2025)
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
di: Goel, Raghavv, et al.
Pubblicazione: (2024)
di: Goel, Raghavv, et al.
Pubblicazione: (2024)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
di: Yang, Penghui, et al.
Pubblicazione: (2025)
di: Yang, Penghui, et al.
Pubblicazione: (2025)
CUPCase: Clinically Uncommon Patient Cases and Diagnoses Dataset
di: Perets, Oriel, et al.
Pubblicazione: (2025)
di: Perets, Oriel, et al.
Pubblicazione: (2025)
Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous Vocabularies
di: Timor, Nadav, et al.
Pubblicazione: (2025)
di: Timor, Nadav, et al.
Pubblicazione: (2025)
Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency
di: Li, Ruixiao, et al.
Pubblicazione: (2025)
di: Li, Ruixiao, et al.
Pubblicazione: (2025)
MineDraft: A Framework for Batch Parallel Speculative Decoding
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
Make Every Draft Count: Hidden State based Speculative Decoding
di: Chen, Yuetao, et al.
Pubblicazione: (2026)
di: Chen, Yuetao, et al.
Pubblicazione: (2026)
PRISM: Parametrically Refactoring Inference for Speculative Sampling Draft Models
di: Wang, Xuliang, et al.
Pubblicazione: (2026)
di: Wang, Xuliang, et al.
Pubblicazione: (2026)
Online Speculative Decoding
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
Exploring and Improving Drafts in Blockwise Parallel Decoding
di: Kim, Taehyeon, et al.
Pubblicazione: (2024)
di: Kim, Taehyeon, et al.
Pubblicazione: (2024)
Mixture of Attentions For Speculative Decoding
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
Draft-Conditioned Constrained Decoding for Structured Generation in LLMs
di: Reddy, Avinash, et al.
Pubblicazione: (2026)
di: Reddy, Avinash, et al.
Pubblicazione: (2026)
Traversal Verification for Speculative Tree Decoding
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
Benchmarking the Energy Savings with Speculative Decoding Strategies
di: Dutta, Rohit, et al.
Pubblicazione: (2026)
di: Dutta, Rohit, et al.
Pubblicazione: (2026)
On Speculative Decoding for Multimodal Large Language Models
di: Gagrani, Mukul, et al.
Pubblicazione: (2024)
di: Gagrani, Mukul, et al.
Pubblicazione: (2024)
HiSpec: Hierarchical Speculative Decoding for LLMs
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
A Theoretical Perspective for Speculative Decoding Algorithm
di: Yin, Ming, et al.
Pubblicazione: (2024)
di: Yin, Ming, et al.
Pubblicazione: (2024)
Cascade Speculative Drafting for Even Faster LLM Inference
di: Chen, Ziyi, et al.
Pubblicazione: (2023)
di: Chen, Ziyi, et al.
Pubblicazione: (2023)
Confidence-Modulated Speculative Decoding for Large Language Models
di: Sen, Jaydip, et al.
Pubblicazione: (2025)
di: Sen, Jaydip, et al.
Pubblicazione: (2025)
Clover: Regressive Lightweight Speculative Decoding with Sequential Knowledge
di: Xiao, Bin, et al.
Pubblicazione: (2024)
di: Xiao, Bin, et al.
Pubblicazione: (2024)
DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models
di: Zhang, Jinbin, et al.
Pubblicazione: (2025)
di: Zhang, Jinbin, et al.
Pubblicazione: (2025)
MedConceptsQA: Open Source Medical Concepts QA Benchmark
di: Shoham, Ofir Ben, et al.
Pubblicazione: (2024)
di: Shoham, Ofir Ben, et al.
Pubblicazione: (2024)
Fast Large Language Model Collaborative Decoding via Speculation
di: Fu, Jiale, et al.
Pubblicazione: (2025)
di: Fu, Jiale, et al.
Pubblicazione: (2025)
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
di: Hu, Yuezhou, et al.
Pubblicazione: (2025)
di: Hu, Yuezhou, et al.
Pubblicazione: (2025)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
di: Zhou, Yongchao, et al.
Pubblicazione: (2023)
di: Zhou, Yongchao, et al.
Pubblicazione: (2023)
Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding
di: Xiao, Bin, et al.
Pubblicazione: (2024)
di: Xiao, Bin, et al.
Pubblicazione: (2024)
FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling
di: Zhao, Weilin, et al.
Pubblicazione: (2025)
di: Zhao, Weilin, et al.
Pubblicazione: (2025)
Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding
di: Ryu, Hyun, et al.
Pubblicazione: (2024)
di: Ryu, Hyun, et al.
Pubblicazione: (2024)
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2025)
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2025)
LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
di: Elhoushi, Mostafa, et al.
Pubblicazione: (2024)
di: Elhoushi, Mostafa, et al.
Pubblicazione: (2024)
Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding
di: Li, Jinze, et al.
Pubblicazione: (2025)
di: Li, Jinze, et al.
Pubblicazione: (2025)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
CPLLM: Clinical Prediction with Large Language Models
di: Shoham, Ofir Ben, et al.
Pubblicazione: (2023) -
$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts
di: Cemri, Mert, et al.
Pubblicazione: (2025) -
Faster Cascades via Speculative Decoding
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024) -
POSS: Position Specialist Generates Better Draft for Speculative Decoding
di: Huang, Langlin, et al.
Pubblicazione: (2025) -
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)