Draft, Verify, and Improve: Toward Training-Aware Speculative Decoding
Fuente:
arXiv
Guardado en:
| Autores principales: | Bhansali, Shrenik, Heck, Larry |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LEGO: Language Model Building Blocks
por: Bhansali, Shrenik, et al.
Publicado: (2024)
por: Bhansali, Shrenik, et al.
Publicado: (2024)
BudgetDraft: Acceptance-Aware Multi-View Training for Sparse-KV Speculative Decoding
por: He, Liang, et al.
Publicado: (2026)
por: He, Liang, et al.
Publicado: (2026)
DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation
por: Liu, Zining, et al.
Publicado: (2026)
por: Liu, Zining, et al.
Publicado: (2026)
FastEagle: Cascaded Drafting for Accelerating Speculative Decoding
por: Huang, Haiduo, et al.
Publicado: (2025)
por: Huang, Haiduo, et al.
Publicado: (2025)
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
por: Hong, Fenglu, et al.
Publicado: (2025)
por: Hong, Fenglu, et al.
Publicado: (2025)
When Drafts Evolve: Speculative Decoding Meets Online Learning
por: Qian, Yu-Yang, et al.
Publicado: (2026)
por: Qian, Yu-Yang, et al.
Publicado: (2026)
Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding
por: Shen, Yuhao, et al.
Publicado: (2026)
por: Shen, Yuhao, et al.
Publicado: (2026)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
por: Huang, Langlin, et al.
Publicado: (2025)
por: Huang, Langlin, et al.
Publicado: (2025)
Beat the long tail: Distribution-Aware Speculative Decoding for RL Training
por: Shao, Zelei, et al.
Publicado: (2025)
por: Shao, Zelei, et al.
Publicado: (2025)
TABED: Test-Time Adaptive Ensemble Drafting for Robust Speculative Decoding in LVLMs
por: Lee, Minjae, et al.
Publicado: (2026)
por: Lee, Minjae, et al.
Publicado: (2026)
SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding
por: Plaksin, Anton, et al.
Publicado: (2026)
por: Plaksin, Anton, et al.
Publicado: (2026)
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
por: Georganas, Evangelos, et al.
Publicado: (2025)
por: Georganas, Evangelos, et al.
Publicado: (2025)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
por: Wen, Zhuofan, et al.
Publicado: (2024)
por: Wen, Zhuofan, et al.
Publicado: (2024)
Balancing Coverage and Draft Latency in Vocabulary Trimming for Faster Speculative Decoding
por: Shoham, Ofir Ben
Publicado: (2026)
por: Shoham, Ofir Ben
Publicado: (2026)
Speculative Safety-Aware Decoding
por: Wang, Xuekang, et al.
Publicado: (2025)
por: Wang, Xuekang, et al.
Publicado: (2025)
OmniDraft: A Cross-vocabulary, Online Adaptive Drafter for On-device Speculative Decoding
por: Ramakrishnan, Ramchalam Kinattinkara, et al.
Publicado: (2025)
por: Ramakrishnan, Ramchalam Kinattinkara, et al.
Publicado: (2025)
MineDraft: A Framework for Batch Parallel Speculative Decoding
por: Tang, Zhenwei, et al.
Publicado: (2026)
por: Tang, Zhenwei, et al.
Publicado: (2026)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
por: Yang, Penghui, et al.
Publicado: (2025)
por: Yang, Penghui, et al.
Publicado: (2025)
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
por: Goel, Raghavv, et al.
Publicado: (2024)
por: Goel, Raghavv, et al.
Publicado: (2024)
Speculative Speculative Decoding
por: Kumar, Tanishq, et al.
Publicado: (2026)
por: Kumar, Tanishq, et al.
Publicado: (2026)
D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting
por: Wu, Tianyu, et al.
Publicado: (2026)
por: Wu, Tianyu, et al.
Publicado: (2026)
Make Every Draft Count: Hidden State based Speculative Decoding
por: Chen, Yuetao, et al.
Publicado: (2026)
por: Chen, Yuetao, et al.
Publicado: (2026)
Exploring and Improving Drafts in Blockwise Parallel Decoding
por: Kim, Taehyeon, et al.
Publicado: (2024)
por: Kim, Taehyeon, et al.
Publicado: (2024)
Cascade Speculative Drafting for Even Faster LLM Inference
por: Chen, Ziyi, et al.
Publicado: (2023)
por: Chen, Ziyi, et al.
Publicado: (2023)
Decoding Speculative Decoding
por: Yan, Minghao, et al.
Publicado: (2024)
por: Yan, Minghao, et al.
Publicado: (2024)
Fail Fast, Win Big: Rethinking the Drafting Strategy in Speculative Decoding via Diffusion LLMs
por: Pan, Rui, et al.
Publicado: (2025)
por: Pan, Rui, et al.
Publicado: (2025)
DEER: Draft with Diffusion, Verify with Autoregressive Models
por: Cheng, Zicong, et al.
Publicado: (2025)
por: Cheng, Zicong, et al.
Publicado: (2025)
MARS: Unleashing the Power of Speculative Decoding via Margin-Aware Verification
por: Song, Jingwei, et al.
Publicado: (2026)
por: Song, Jingwei, et al.
Publicado: (2026)
Dynamic Delayed Tree Expansion For Improved Multi-Path Speculative Decoding
por: Thomas, Rahul, et al.
Publicado: (2026)
por: Thomas, Rahul, et al.
Publicado: (2026)
Global Resolution: Optimal Multi-Draft Speculative Sampling via Convex Minimization
por: Thomas, Rahul Krishna, et al.
Publicado: (2025)
por: Thomas, Rahul Krishna, et al.
Publicado: (2025)
Weight-of-Thought Reasoning: Exploring Neural Network Weights for Enhanced LLM Reasoning
por: Punjwani, Saif, et al.
Publicado: (2025)
por: Punjwani, Saif, et al.
Publicado: (2025)
Co2PO: Coordinated Constrained Policy Optimization for Multi-Agent RL
por: Patel, Shrenik, et al.
Publicado: (2026)
por: Patel, Shrenik, et al.
Publicado: (2026)
Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
por: Ziashahabi, Amir, et al.
Publicado: (2025)
por: Ziashahabi, Amir, et al.
Publicado: (2025)
PRISM: Parametrically Refactoring Inference for Speculative Sampling Draft Models
por: Wang, Xuliang, et al.
Publicado: (2026)
por: Wang, Xuliang, et al.
Publicado: (2026)
Hydra: Sequentially-Dependent Draft Heads for Medusa Decoding
por: Ankner, Zachary, et al.
Publicado: (2024)
por: Ankner, Zachary, et al.
Publicado: (2024)
FastGRPO: Accelerating Policy Optimization via Concurrency-aware Speculative Decoding and Online Draft Learning
por: Zhang, Yizhou, et al.
Publicado: (2025)
por: Zhang, Yizhou, et al.
Publicado: (2025)
AdaEDL: Early Draft Stopping for Speculative Decoding of Large Language Models via an Entropy-based Lower Bound on Token Acceptance Probability
por: Agrawal, Sudhanshu, et al.
Publicado: (2024)
por: Agrawal, Sudhanshu, et al.
Publicado: (2024)
Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models
por: Wu, Shutong, et al.
Publicado: (2025)
por: Wu, Shutong, et al.
Publicado: (2025)
Pruner: A Draft-then-Verify Exploration Mechanism to Accelerate Tensor Program Tuning
por: Qiao, Liang, et al.
Publicado: (2024)
por: Qiao, Liang, et al.
Publicado: (2024)
Speculative Decoding Across Languages
por: Paudel, Nirajan, et al.
Publicado: (2026)
por: Paudel, Nirajan, et al.
Publicado: (2026)
Ejemplares similares
-
LEGO: Language Model Building Blocks
por: Bhansali, Shrenik, et al.
Publicado: (2024) -
BudgetDraft: Acceptance-Aware Multi-View Training for Sparse-KV Speculative Decoding
por: He, Liang, et al.
Publicado: (2026) -
DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation
por: Liu, Zining, et al.
Publicado: (2026) -
FastEagle: Cascaded Drafting for Accelerating Speculative Decoding
por: Huang, Haiduo, et al.
Publicado: (2025) -
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
por: Hong, Fenglu, et al.
Publicado: (2025)