Fast Best-of-N Decoding via Speculative Rejection
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Hanshi, Haider, Momin, Zhang, Ruiqi, Yang, Huitao, Qiu, Jiahao, Yin, Ming, Wang, Mengdi, Bartlett, Peter, Zanette, Andrea |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Theoretical Perspective for Speculative Decoding Algorithm
por: Yin, Ming, et al.
Publicado: (2024)
por: Yin, Ming, et al.
Publicado: (2024)
TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
por: Sun, Hanshi, et al.
Publicado: (2024)
por: Sun, Hanshi, et al.
Publicado: (2024)
TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling
por: Qiu, Jiahao, et al.
Publicado: (2024)
por: Qiu, Jiahao, et al.
Publicado: (2024)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
por: Huang, Kaixuan, et al.
Publicado: (2024)
por: Huang, Kaixuan, et al.
Publicado: (2024)
Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
por: Ziashahabi, Amir, et al.
Publicado: (2025)
por: Ziashahabi, Amir, et al.
Publicado: (2025)
Efficient Adaptive Rejection Sampling for Accelerating Speculative Decoding in Large Language Models
por: Sun, Chendong, et al.
Publicado: (2025)
por: Sun, Chendong, et al.
Publicado: (2025)
Fast Large Language Model Collaborative Decoding via Speculation
por: Fu, Jiale, et al.
Publicado: (2025)
por: Fu, Jiale, et al.
Publicado: (2025)
Graph-Structured Speculative Decoding
por: Gong, Zhuocheng, et al.
Publicado: (2024)
por: Gong, Zhuocheng, et al.
Publicado: (2024)
SpecTr: Fast Speculative Decoding via Optimal Transport
por: Sun, Ziteng, et al.
Publicado: (2023)
por: Sun, Ziteng, et al.
Publicado: (2023)
Recurrent Drafter for Fast Speculative Decoding in Large Language Models
por: Cheng, Yunfei, et al.
Publicado: (2024)
por: Cheng, Yunfei, et al.
Publicado: (2024)
DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference
por: Liu, Fuliang, et al.
Publicado: (2026)
por: Liu, Fuliang, et al.
Publicado: (2026)
Cost-Aware Diffusion Draft Trees for Speculative Decoding
por: Zhang, Shuai, et al.
Publicado: (2026)
por: Zhang, Shuai, et al.
Publicado: (2026)
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
por: Liu, Tianyu, et al.
Publicado: (2025)
por: Liu, Tianyu, et al.
Publicado: (2025)
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
por: Liu, Jiahao, et al.
Publicado: (2024)
por: Liu, Jiahao, et al.
Publicado: (2024)
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
por: Hong, Fenglu, et al.
Publicado: (2025)
por: Hong, Fenglu, et al.
Publicado: (2025)
Online Speculative Decoding
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
SAM Decoding: Speculative Decoding via Suffix Automaton
por: Hu, Yuxuan, et al.
Publicado: (2024)
por: Hu, Yuxuan, et al.
Publicado: (2024)
Beyond the Target: From Imitation to Collaboration in Speculative Decoding
por: Li, Jinze, et al.
Publicado: (2026)
por: Li, Jinze, et al.
Publicado: (2026)
In-Context Learning of a Linear Transformer Block: Benefits of the MLP Component and One-Step GD Initialization
por: Zhang, Ruiqi, et al.
Publicado: (2024)
por: Zhang, Ruiqi, et al.
Publicado: (2024)
Speculative Decoding with a Speculative Vocabulary
por: Williams, Miles, et al.
Publicado: (2026)
por: Williams, Miles, et al.
Publicado: (2026)
Decoding Speculative Decoding
por: Yan, Minghao, et al.
Publicado: (2024)
por: Yan, Minghao, et al.
Publicado: (2024)
Multi-Candidate Speculative Decoding
por: Yang, Sen, et al.
Publicado: (2024)
por: Yang, Sen, et al.
Publicado: (2024)
S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation
por: Han, Ligong, et al.
Publicado: (2026)
por: Han, Ligong, et al.
Publicado: (2026)
Towards Fast Multilingual LLM Inference: Speculative Decoding and Specialized Drafters
por: Yi, Euiin, et al.
Publicado: (2024)
por: Yi, Euiin, et al.
Publicado: (2024)
DuoDecoding: Hardware-aware Heterogeneous Speculative Decoding with Dynamic Multi-Sequence Drafting
por: Lv, Kai, et al.
Publicado: (2025)
por: Lv, Kai, et al.
Publicado: (2025)
Dynamic Depth Decoding: Faster Speculative Decoding for LLMs
por: Brown, Oscar, et al.
Publicado: (2024)
por: Brown, Oscar, et al.
Publicado: (2024)
Speculative Contrastive Decoding
por: Yuan, Hongyi, et al.
Publicado: (2023)
por: Yuan, Hongyi, et al.
Publicado: (2023)
Accelerating Unbiased LLM Evaluation via Synthetic Feedback
por: Zhou, Zhaoyi, et al.
Publicado: (2025)
por: Zhou, Zhaoyi, et al.
Publicado: (2025)
Accelerate Speculative Decoding with Sparse Computation in Verification
por: Wang, Jikai, et al.
Publicado: (2025)
por: Wang, Jikai, et al.
Publicado: (2025)
Training Language Models to Reason Efficiently
por: Arora, Daman, et al.
Publicado: (2025)
por: Arora, Daman, et al.
Publicado: (2025)
Speculative Pipeline Decoding: Higher-Accruacy and Zero-Bubble Speculation via Pipeline Parallelism
por: Yu, Yijiong, et al.
Publicado: (2026)
por: Yu, Yijiong, et al.
Publicado: (2026)
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
por: Wang, Pei-Shuo, et al.
Publicado: (2025)
por: Wang, Pei-Shuo, et al.
Publicado: (2025)
Faster Cascades via Speculative Decoding
por: Narasimhan, Harikrishna, et al.
Publicado: (2024)
por: Narasimhan, Harikrishna, et al.
Publicado: (2024)
Traversal Verification for Speculative Tree Decoding
por: Weng, Yepeng, et al.
Publicado: (2025)
por: Weng, Yepeng, et al.
Publicado: (2025)
Scaling Laws for Speculative Decoding
por: Yan, Siyuan, et al.
Publicado: (2025)
por: Yan, Siyuan, et al.
Publicado: (2025)
Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE
por: Huang, Haiduo, et al.
Publicado: (2025)
por: Huang, Haiduo, et al.
Publicado: (2025)
Temperature-Centric Investigation of Speculative Decoding with Knowledge Distillation
por: Ouyang, Siru, et al.
Publicado: (2024)
por: Ouyang, Siru, et al.
Publicado: (2024)
TALON: Confidence-Aware Speculative Decoding with Adaptive Token Trees
por: Liu, Tianyu, et al.
Publicado: (2026)
por: Liu, Tianyu, et al.
Publicado: (2026)
3-Model Speculative Decoding
por: Byun, Sanghyun, et al.
Publicado: (2025)
por: Byun, Sanghyun, et al.
Publicado: (2025)
SEED: Accelerating Reasoning Tree Construction via Scheduled Speculative Decoding
por: Wang, Zhenglin, et al.
Publicado: (2024)
por: Wang, Zhenglin, et al.
Publicado: (2024)
Ejemplares similares
-
A Theoretical Perspective for Speculative Decoding Algorithm
por: Yin, Ming, et al.
Publicado: (2024) -
TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
por: Sun, Hanshi, et al.
Publicado: (2024) -
TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling
por: Qiu, Jiahao, et al.
Publicado: (2024) -
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
por: Huang, Kaixuan, et al.
Publicado: (2024) -
Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
por: Ziashahabi, Amir, et al.
Publicado: (2025)