Beyond the Speculative Game: A Survey of Speculative Execution in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Chen, Liu, Zhuorui, Song, Dawei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
On Speculative Decoding for Multimodal Large Language Models
por: Gagrani, Mukul, et al.
Publicado: (2024)
por: Gagrani, Mukul, et al.
Publicado: (2024)
Accelerating Large Language Model Reasoning via Speculative Search
por: Wang, Zhihai, et al.
Publicado: (2025)
por: Wang, Zhihai, et al.
Publicado: (2025)
Scaling Laws for Speculative Decoding
por: Yan, Siyuan, et al.
Publicado: (2025)
por: Yan, Siyuan, et al.
Publicado: (2025)
Fast Large Language Model Collaborative Decoding via Speculation
por: Fu, Jiale, et al.
Publicado: (2025)
por: Fu, Jiale, et al.
Publicado: (2025)
Confidence-Modulated Speculative Decoding for Large Language Models
por: Sen, Jaydip, et al.
Publicado: (2025)
por: Sen, Jaydip, et al.
Publicado: (2025)
SpecExit: Accelerating Large Reasoning Model via Speculative Exit
por: Yang, Rubing, et al.
Publicado: (2025)
por: Yang, Rubing, et al.
Publicado: (2025)
Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding
por: Jin, Tao, et al.
Publicado: (2026)
por: Jin, Tao, et al.
Publicado: (2026)
Mamba Drafters for Speculative Decoding
por: Choi, Daewon, et al.
Publicado: (2025)
por: Choi, Daewon, et al.
Publicado: (2025)
Speculative Decoding: Performance or Illusion?
por: Liu, Xiaoxuan, et al.
Publicado: (2025)
por: Liu, Xiaoxuan, et al.
Publicado: (2025)
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
por: Li, Guanghao, et al.
Publicado: (2025)
por: Li, Guanghao, et al.
Publicado: (2025)
Speculate, then Collaborate: Fusing Knowledge of Language Models during Decoding
por: Wang, Ziyao, et al.
Publicado: (2025)
por: Wang, Ziyao, et al.
Publicado: (2025)
HADES: Hardware Accelerated Decoding for Efficient Speculation in Large Language Models
por: Yang, Ze, et al.
Publicado: (2024)
por: Yang, Ze, et al.
Publicado: (2024)
Online Speculative Decoding
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
S$^4$C: Speculative Sampling with Syntactic and Semantic Coherence for Efficient Inference of Large Language Models
por: He, Tao, et al.
Publicado: (2025)
por: He, Tao, et al.
Publicado: (2025)
Batch Speculative Decoding Done Right
por: Zhang, Ranran Haoran, et al.
Publicado: (2025)
por: Zhang, Ranran Haoran, et al.
Publicado: (2025)
DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models
por: Zhang, Jinbin, et al.
Publicado: (2025)
por: Zhang, Jinbin, et al.
Publicado: (2025)
FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling
por: Zhao, Weilin, et al.
Publicado: (2025)
por: Zhao, Weilin, et al.
Publicado: (2025)
Speculative Decoding for Multi-Sample Inference
por: Li, Yiwei, et al.
Publicado: (2025)
por: Li, Yiwei, et al.
Publicado: (2025)
RASD: Retrieval-Augmented Speculative Decoding
por: Quan, Guofeng, et al.
Publicado: (2025)
por: Quan, Guofeng, et al.
Publicado: (2025)
Constrained Decoding with Speculative Lookaheads
por: Nakshatri, Nishanth, et al.
Publicado: (2024)
por: Nakshatri, Nishanth, et al.
Publicado: (2024)
The Disparate Impacts of Speculative Decoding
por: Sandler, Jameson, et al.
Publicado: (2025)
por: Sandler, Jameson, et al.
Publicado: (2025)
Cross-Attention Speculative Decoding
por: Zhong, Wei, et al.
Publicado: (2025)
por: Zhong, Wei, et al.
Publicado: (2025)
Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation
por: Liu, Jingyu, et al.
Publicado: (2025)
por: Liu, Jingyu, et al.
Publicado: (2025)
Speculative Thinking: Enhancing Small-Model Reasoning with Large Model Guidance at Inference Time
por: Yang, Wang, et al.
Publicado: (2025)
por: Yang, Wang, et al.
Publicado: (2025)
Distributed Speculative Inference (DSI): Speculation Parallelism for Provably Faster Lossless Language Model Inference
por: Timor, Nadav, et al.
Publicado: (2024)
por: Timor, Nadav, et al.
Publicado: (2024)
PACER: Blockwise Pre-verification for Speculative Decoding with Adaptive Length
por: Zhang, Situo, et al.
Publicado: (2026)
por: Zhang, Situo, et al.
Publicado: (2026)
Cacheback: Speculative Decoding With Nothing But Cache
por: Ma, Zhiyao, et al.
Publicado: (2025)
por: Ma, Zhiyao, et al.
Publicado: (2025)
RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding
por: Zhang, Zihong, et al.
Publicado: (2026)
por: Zhang, Zihong, et al.
Publicado: (2026)
Traversal Verification for Speculative Tree Decoding
por: Weng, Yepeng, et al.
Publicado: (2025)
por: Weng, Yepeng, et al.
Publicado: (2025)
PRISM: Parametrically Refactoring Inference for Speculative Sampling Draft Models
por: Wang, Xuliang, et al.
Publicado: (2026)
por: Wang, Xuliang, et al.
Publicado: (2026)
Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding
por: Ryu, Hyun, et al.
Publicado: (2024)
por: Ryu, Hyun, et al.
Publicado: (2024)
Efficient Adaptive Rejection Sampling for Accelerating Speculative Decoding in Large Language Models
por: Sun, Chendong, et al.
Publicado: (2025)
por: Sun, Chendong, et al.
Publicado: (2025)
Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models
por: Huang, Liangjie, et al.
Publicado: (2025)
por: Huang, Liangjie, et al.
Publicado: (2025)
Cooperative Strategic Planning Enhances Reasoning Capabilities in Large Language Models
por: Wang, Danqing, et al.
Publicado: (2024)
por: Wang, Danqing, et al.
Publicado: (2024)
PARD-2: Target-Aligned Parallel Draft Model for Dual-Mode Speculative Decoding
por: An, Zihao, et al.
Publicado: (2026)
por: An, Zihao, et al.
Publicado: (2026)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
por: Zhang, Situo, et al.
Publicado: (2024)
por: Zhang, Situo, et al.
Publicado: (2024)
A Theoretical Perspective for Speculative Decoding Algorithm
por: Yin, Ming, et al.
Publicado: (2024)
por: Yin, Ming, et al.
Publicado: (2024)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
por: Sun, Ryan, et al.
Publicado: (2024)
por: Sun, Ryan, et al.
Publicado: (2024)
Entropy-Aware Speculative Decoding Toward Improved LLM Reasoning
por: Su, Tiancheng, et al.
Publicado: (2025)
por: Su, Tiancheng, et al.
Publicado: (2025)
Speculative RAG: Enhancing Retrieval Augmented Generation through Drafting
por: Wang, Zilong, et al.
Publicado: (2024)
por: Wang, Zilong, et al.
Publicado: (2024)
Ejemplares similares
-
On Speculative Decoding for Multimodal Large Language Models
por: Gagrani, Mukul, et al.
Publicado: (2024) -
Accelerating Large Language Model Reasoning via Speculative Search
por: Wang, Zhihai, et al.
Publicado: (2025) -
Scaling Laws for Speculative Decoding
por: Yan, Siyuan, et al.
Publicado: (2025) -
Fast Large Language Model Collaborative Decoding via Speculation
por: Fu, Jiale, et al.
Publicado: (2025) -
Confidence-Modulated Speculative Decoding for Large Language Models
por: Sen, Jaydip, et al.
Publicado: (2025)