SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Ryan, Zhou, Tianyi, Chen, Xun, Sun, Lichao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
par: Georganas, Evangelos, et autres
Publié: (2025)
par: Georganas, Evangelos, et autres
Publié: (2025)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
par: Yang, Penghui, et autres
Publié: (2025)
par: Yang, Penghui, et autres
Publié: (2025)
SpecTr-GBV: Multi-Draft Block Verification Accelerating Speculative Decoding
par: Lin, Yijun, et autres
Publié: (2026)
par: Lin, Yijun, et autres
Publié: (2026)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
par: Wen, Zhuofan, et autres
Publié: (2024)
par: Wen, Zhuofan, et autres
Publié: (2024)
TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding
par: Wu, Zhaoxuan, et autres
Publié: (2025)
par: Wu, Zhaoxuan, et autres
Publié: (2025)
Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
par: Hu, Shijing, et autres
Publié: (2025)
par: Hu, Shijing, et autres
Publié: (2025)
HiSpec: Hierarchical Speculative Decoding for LLMs
par: Kumar, Avinash, et autres
Publié: (2025)
par: Kumar, Avinash, et autres
Publié: (2025)
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
par: Li, Guanghao, et autres
Publié: (2025)
par: Li, Guanghao, et autres
Publié: (2025)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
par: Zhou, Yongchao, et autres
Publié: (2023)
par: Zhou, Yongchao, et autres
Publié: (2023)
EvoSpec: Evolving Speculative Decoding via Real-Time Vocabulary and Parameter Adaptation
par: Zhang, Shuyu, et autres
Publié: (2026)
par: Zhang, Shuyu, et autres
Publié: (2026)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
par: Zhang, Situo, et autres
Publié: (2024)
par: Zhang, Situo, et autres
Publié: (2024)
FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling
par: Zhao, Weilin, et autres
Publié: (2025)
par: Zhao, Weilin, et autres
Publié: (2025)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
par: Huang, Langlin, et autres
Publié: (2025)
par: Huang, Langlin, et autres
Publié: (2025)
Draft Model Knows When to Stop: Self-Verification Speculative Decoding for Long-Form Generation
par: Zhang, Ziyin, et autres
Publié: (2024)
par: Zhang, Ziyin, et autres
Publié: (2024)
PARD-2: Target-Aligned Parallel Draft Model for Dual-Mode Speculative Decoding
par: An, Zihao, et autres
Publié: (2026)
par: An, Zihao, et autres
Publié: (2026)
SpecExit: Accelerating Large Reasoning Model via Speculative Exit
par: Yang, Rubing, et autres
Publié: (2025)
par: Yang, Rubing, et autres
Publié: (2025)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
par: Huang, Kaixuan, et autres
Publié: (2024)
par: Huang, Kaixuan, et autres
Publié: (2024)
MineDraft: A Framework for Batch Parallel Speculative Decoding
par: Tang, Zhenwei, et autres
Publié: (2026)
par: Tang, Zhenwei, et autres
Publié: (2026)
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
par: Hong, Fenglu, et autres
Publié: (2025)
par: Hong, Fenglu, et autres
Publié: (2025)
Balancing Coverage and Draft Latency in Vocabulary Trimming for Faster Speculative Decoding
par: Shoham, Ofir Ben
Publié: (2026)
par: Shoham, Ofir Ben
Publié: (2026)
SpecForge: A Flexible and Efficient Open-Source Training Framework for Speculative Decoding
par: Li, Shenggui, et autres
Publié: (2026)
par: Li, Shenggui, et autres
Publié: (2026)
SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding
par: Plaksin, Anton, et autres
Publié: (2026)
par: Plaksin, Anton, et autres
Publié: (2026)
SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting
par: Shi, Weijie, et autres
Publié: (2026)
par: Shi, Weijie, et autres
Publié: (2026)
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
par: Goel, Raghavv, et autres
Publié: (2024)
par: Goel, Raghavv, et autres
Publié: (2024)
Make Every Draft Count: Hidden State based Speculative Decoding
par: Chen, Yuetao, et autres
Publié: (2026)
par: Chen, Yuetao, et autres
Publié: (2026)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
par: Ji, Yicheng, et autres
Publié: (2025)
par: Ji, Yicheng, et autres
Publié: (2025)
SpecBranch: Speculative Decoding via Hybrid Drafting and Rollback-Aware Branch Parallelism
par: Shen, Yuhao, et autres
Publié: (2025)
par: Shen, Yuhao, et autres
Publié: (2025)
Speculative Decoding for Multi-Sample Inference
par: Li, Yiwei, et autres
Publié: (2025)
par: Li, Yiwei, et autres
Publié: (2025)
Speculative RAG: Enhancing Retrieval Augmented Generation through Drafting
par: Wang, Zilong, et autres
Publié: (2024)
par: Wang, Zilong, et autres
Publié: (2024)
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
par: Liu, Tianyu, et autres
Publié: (2025)
par: Liu, Tianyu, et autres
Publié: (2025)
Efficient Adaptive Rejection Sampling for Accelerating Speculative Decoding in Large Language Models
par: Sun, Chendong, et autres
Publié: (2025)
par: Sun, Chendong, et autres
Publié: (2025)
$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts
par: Cemri, Mert, et autres
Publié: (2025)
par: Cemri, Mert, et autres
Publié: (2025)
Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?
par: Fan, Chenrui, et autres
Publié: (2025)
par: Fan, Chenrui, et autres
Publié: (2025)
Scaling Laws for Speculative Decoding
par: Yan, Siyuan, et autres
Publié: (2025)
par: Yan, Siyuan, et autres
Publié: (2025)
SpecKV: Adaptive Speculative Decoding with Compression-Aware Gamma Selection
par: Shukla, Shikhar
Publié: (2026)
par: Shukla, Shikhar
Publié: (2026)
PRISM: Parametrically Refactoring Inference for Speculative Sampling Draft Models
par: Wang, Xuliang, et autres
Publié: (2026)
par: Wang, Xuliang, et autres
Publié: (2026)
SpecExtend: A Drop-in Enhancement for Speculative Decoding of Long Sequences
par: Cha, Jungyoub, et autres
Publié: (2025)
par: Cha, Jungyoub, et autres
Publié: (2025)
C2T: A Classifier-Based Tree Construction Method in Speculative Decoding
par: Huo, Feiye, et autres
Publié: (2025)
par: Huo, Feiye, et autres
Publié: (2025)
Constrained Decoding with Speculative Lookaheads
par: Nakshatri, Nishanth, et autres
Publié: (2024)
par: Nakshatri, Nishanth, et autres
Publié: (2024)
The Disparate Impacts of Speculative Decoding
par: Sandler, Jameson, et autres
Publié: (2025)
par: Sandler, Jameson, et autres
Publié: (2025)
Documents similaires
-
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
par: Georganas, Evangelos, et autres
Publié: (2025) -
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
par: Yang, Penghui, et autres
Publié: (2025) -
SpecTr-GBV: Multi-Draft Block Verification Accelerating Speculative Decoding
par: Lin, Yijun, et autres
Publié: (2026) -
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
par: Wen, Zhuofan, et autres
Publié: (2024) -
TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding
par: Wu, Zhaoxuan, et autres
Publié: (2025)