Speculative Decoding and Beyond: An In-Depth Survey of Techniques
Fuente:
arXiv
Guardado en:
| Autores principales: | Hu, Yunhai, Liu, Zining, Dong, Zhenyuan, Peng, Tianfan, McDanel, Bradley, Zhang, Sai Qian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AMUSD: Asynchronous Multi-Device Speculative Decoding for LLM Acceleration
por: McDanel, Bradley
Publicado: (2024)
por: McDanel, Bradley
Publicado: (2024)
PipeSpec: Breaking Stage Dependencies in Hierarchical LLM Decoding
por: McDanel, Bradley, et al.
Publicado: (2025)
por: McDanel, Bradley, et al.
Publicado: (2025)
DSD: A Distributed Speculative Decoding Solution for Edge-Cloud Agile Large Model Serving
por: Yu, Fengze, et al.
Publicado: (2025)
por: Yu, Fengze, et al.
Publicado: (2025)
CLAA: Cross-Layer Attention Aggregation for Accelerating LLM Prefill
por: McDanel, Bradley, et al.
Publicado: (2026)
por: McDanel, Bradley, et al.
Publicado: (2026)
Beyond Trusting Trust: Multi-Model Validation for Robust Code Generation
por: McDanel, Bradley
Publicado: (2025)
por: McDanel, Bradley
Publicado: (2025)
DREAM: Drafting with Refined Target Features and Entropy-Adaptive Cross-Attention Fusion for Multimodal Speculative Decoding
por: Hu, Yunhai, et al.
Publicado: (2025)
por: Hu, Yunhai, et al.
Publicado: (2025)
MoE-Spec: Expert Budgeting for Efficient Speculative Decoding
por: McDanel, Bradley, et al.
Publicado: (2026)
por: McDanel, Bradley, et al.
Publicado: (2026)
Beyond the Target: From Imitation to Collaboration in Speculative Decoding
por: Li, Jinze, et al.
Publicado: (2026)
por: Li, Jinze, et al.
Publicado: (2026)
Dynamic Depth Decoding: Faster Speculative Decoding for LLMs
por: Brown, Oscar, et al.
Publicado: (2024)
por: Brown, Oscar, et al.
Publicado: (2024)
DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation
por: Liu, Zining, et al.
Publicado: (2026)
por: Liu, Zining, et al.
Publicado: (2026)
Beyond the Speculative Game: A Survey of Speculative Execution in Large Language Models
por: Zhang, Chen, et al.
Publicado: (2024)
por: Zhang, Chen, et al.
Publicado: (2024)
Online Speculative Decoding
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding
por: Xia, Heming, et al.
Publicado: (2024)
por: Xia, Heming, et al.
Publicado: (2024)
Tutorial Proposal: Speculative Decoding for Efficient LLM Inference
por: Xia, Heming, et al.
Publicado: (2025)
por: Xia, Heming, et al.
Publicado: (2025)
Speculative Decoding with a Speculative Vocabulary
por: Williams, Miles, et al.
Publicado: (2026)
por: Williams, Miles, et al.
Publicado: (2026)
Beyond Tokens: Semantic-Aware Speculative Decoding for Efficient Inference by Probing Internal States
por: Dong, Ximing, et al.
Publicado: (2026)
por: Dong, Ximing, et al.
Publicado: (2026)
Two Charismatic Giants of History and Literature:King David and Hamlet
por: Mary Anne McDanel García
Publicado: (2017)
por: Mary Anne McDanel García
Publicado: (2017)
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
por: Liu, Tianyu, et al.
Publicado: (2024)
por: Liu, Tianyu, et al.
Publicado: (2024)
Decoding Speculative Decoding
por: Yan, Minghao, et al.
Publicado: (2024)
por: Yan, Minghao, et al.
Publicado: (2024)
Graph-Structured Speculative Decoding
por: Gong, Zhuocheng, et al.
Publicado: (2024)
por: Gong, Zhuocheng, et al.
Publicado: (2024)
Speculative Contrastive Decoding
por: Yuan, Hongyi, et al.
Publicado: (2023)
por: Yuan, Hongyi, et al.
Publicado: (2023)
Accelerate Speculative Decoding with Sparse Computation in Verification
por: Wang, Jikai, et al.
Publicado: (2025)
por: Wang, Jikai, et al.
Publicado: (2025)
Training-Free Loosely Speculative Decoding: Accepting Semantically Correct Drafts Beyond Exact Match
por: Li, Jinze, et al.
Publicado: (2025)
por: Li, Jinze, et al.
Publicado: (2025)
Speculative Decoding for Multi-Sample Inference
por: Li, Yiwei, et al.
Publicado: (2025)
por: Li, Yiwei, et al.
Publicado: (2025)
SAM Decoding: Speculative Decoding via Suffix Automaton
por: Hu, Yuxuan, et al.
Publicado: (2024)
por: Hu, Yuxuan, et al.
Publicado: (2024)
Speculative Decoding: Performance or Illusion?
por: Liu, Xiaoxuan, et al.
Publicado: (2025)
por: Liu, Xiaoxuan, et al.
Publicado: (2025)
DFlash: Block Diffusion for Flash Speculative Decoding
por: Chen, Jian, et al.
Publicado: (2026)
por: Chen, Jian, et al.
Publicado: (2026)
3-Model Speculative Decoding
por: Byun, Sanghyun, et al.
Publicado: (2025)
por: Byun, Sanghyun, et al.
Publicado: (2025)
Multi-Candidate Speculative Decoding
por: Yang, Sen, et al.
Publicado: (2024)
por: Yang, Sen, et al.
Publicado: (2024)
Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding
por: Kim, Sungkyun, et al.
Publicado: (2025)
por: Kim, Sungkyun, et al.
Publicado: (2025)
Scaling Laws for Speculative Decoding
por: Yan, Siyuan, et al.
Publicado: (2025)
por: Yan, Siyuan, et al.
Publicado: (2025)
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
por: Xiao, Zilin, et al.
Publicado: (2024)
por: Xiao, Zilin, et al.
Publicado: (2024)
Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
por: Ziashahabi, Amir, et al.
Publicado: (2025)
por: Ziashahabi, Amir, et al.
Publicado: (2025)
Traversal Verification for Speculative Tree Decoding
por: Weng, Yepeng, et al.
Publicado: (2025)
por: Weng, Yepeng, et al.
Publicado: (2025)
Batch Speculative Decoding Done Right
por: Zhang, Ranran Haoran, et al.
Publicado: (2025)
por: Zhang, Ranran Haoran, et al.
Publicado: (2025)
Dynamic Speculation Lookahead Accelerates Speculative Decoding of Large Language Models
por: Mamou, Jonathan, et al.
Publicado: (2024)
por: Mamou, Jonathan, et al.
Publicado: (2024)
Improving Multi-candidate Speculative Decoding
por: Lu, Xiaofan, et al.
Publicado: (2024)
por: Lu, Xiaofan, et al.
Publicado: (2024)
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
por: Liu, Tianyu, et al.
Publicado: (2025)
por: Liu, Tianyu, et al.
Publicado: (2025)
Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions
por: Tang, Bangsheng, et al.
Publicado: (2025)
por: Tang, Bangsheng, et al.
Publicado: (2025)
Judge Decoding: Faster Speculative Sampling Requires Going Beyond Model Alignment
por: Bachmann, Gregor, et al.
Publicado: (2025)
por: Bachmann, Gregor, et al.
Publicado: (2025)
Ejemplares similares
-
AMUSD: Asynchronous Multi-Device Speculative Decoding for LLM Acceleration
por: McDanel, Bradley
Publicado: (2024) -
PipeSpec: Breaking Stage Dependencies in Hierarchical LLM Decoding
por: McDanel, Bradley, et al.
Publicado: (2025) -
DSD: A Distributed Speculative Decoding Solution for Edge-Cloud Agile Large Model Serving
por: Yu, Fengze, et al.
Publicado: (2025) -
CLAA: Cross-Layer Attention Aggregation for Accelerating LLM Prefill
por: McDanel, Bradley, et al.
Publicado: (2026) -
Beyond Trusting Trust: Multi-Model Validation for Robust Code Generation
por: McDanel, Bradley
Publicado: (2025)