Fast Best-of-N Decoding via Speculative Rejection
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Hanshi, Haider, Momin, Zhang, Ruiqi, Yang, Huitao, Qiu, Jiahao, Yin, Ming, Wang, Mengdi, Bartlett, Peter, Zanette, Andrea |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Theoretical Perspective for Speculative Decoding Algorithm
di: Yin, Ming, et al.
Pubblicazione: (2024)
di: Yin, Ming, et al.
Pubblicazione: (2024)
TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
di: Sun, Hanshi, et al.
Pubblicazione: (2024)
di: Sun, Hanshi, et al.
Pubblicazione: (2024)
TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling
di: Qiu, Jiahao, et al.
Pubblicazione: (2024)
di: Qiu, Jiahao, et al.
Pubblicazione: (2024)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
di: Ziashahabi, Amir, et al.
Pubblicazione: (2025)
di: Ziashahabi, Amir, et al.
Pubblicazione: (2025)
Efficient Adaptive Rejection Sampling for Accelerating Speculative Decoding in Large Language Models
di: Sun, Chendong, et al.
Pubblicazione: (2025)
di: Sun, Chendong, et al.
Pubblicazione: (2025)
Fast Large Language Model Collaborative Decoding via Speculation
di: Fu, Jiale, et al.
Pubblicazione: (2025)
di: Fu, Jiale, et al.
Pubblicazione: (2025)
Graph-Structured Speculative Decoding
di: Gong, Zhuocheng, et al.
Pubblicazione: (2024)
di: Gong, Zhuocheng, et al.
Pubblicazione: (2024)
SpecTr: Fast Speculative Decoding via Optimal Transport
di: Sun, Ziteng, et al.
Pubblicazione: (2023)
di: Sun, Ziteng, et al.
Pubblicazione: (2023)
Recurrent Drafter for Fast Speculative Decoding in Large Language Models
di: Cheng, Yunfei, et al.
Pubblicazione: (2024)
di: Cheng, Yunfei, et al.
Pubblicazione: (2024)
DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference
di: Liu, Fuliang, et al.
Pubblicazione: (2026)
di: Liu, Fuliang, et al.
Pubblicazione: (2026)
Cost-Aware Diffusion Draft Trees for Speculative Decoding
di: Zhang, Shuai, et al.
Pubblicazione: (2026)
di: Zhang, Shuai, et al.
Pubblicazione: (2026)
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
di: Liu, Tianyu, et al.
Pubblicazione: (2025)
di: Liu, Tianyu, et al.
Pubblicazione: (2025)
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
di: Liu, Jiahao, et al.
Pubblicazione: (2024)
di: Liu, Jiahao, et al.
Pubblicazione: (2024)
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
di: Hong, Fenglu, et al.
Pubblicazione: (2025)
di: Hong, Fenglu, et al.
Pubblicazione: (2025)
Online Speculative Decoding
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
SAM Decoding: Speculative Decoding via Suffix Automaton
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
Beyond the Target: From Imitation to Collaboration in Speculative Decoding
di: Li, Jinze, et al.
Pubblicazione: (2026)
di: Li, Jinze, et al.
Pubblicazione: (2026)
In-Context Learning of a Linear Transformer Block: Benefits of the MLP Component and One-Step GD Initialization
di: Zhang, Ruiqi, et al.
Pubblicazione: (2024)
di: Zhang, Ruiqi, et al.
Pubblicazione: (2024)
Speculative Decoding with a Speculative Vocabulary
di: Williams, Miles, et al.
Pubblicazione: (2026)
di: Williams, Miles, et al.
Pubblicazione: (2026)
Decoding Speculative Decoding
di: Yan, Minghao, et al.
Pubblicazione: (2024)
di: Yan, Minghao, et al.
Pubblicazione: (2024)
Multi-Candidate Speculative Decoding
di: Yang, Sen, et al.
Pubblicazione: (2024)
di: Yang, Sen, et al.
Pubblicazione: (2024)
S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation
di: Han, Ligong, et al.
Pubblicazione: (2026)
di: Han, Ligong, et al.
Pubblicazione: (2026)
Towards Fast Multilingual LLM Inference: Speculative Decoding and Specialized Drafters
di: Yi, Euiin, et al.
Pubblicazione: (2024)
di: Yi, Euiin, et al.
Pubblicazione: (2024)
DuoDecoding: Hardware-aware Heterogeneous Speculative Decoding with Dynamic Multi-Sequence Drafting
di: Lv, Kai, et al.
Pubblicazione: (2025)
di: Lv, Kai, et al.
Pubblicazione: (2025)
Dynamic Depth Decoding: Faster Speculative Decoding for LLMs
di: Brown, Oscar, et al.
Pubblicazione: (2024)
di: Brown, Oscar, et al.
Pubblicazione: (2024)
Speculative Contrastive Decoding
di: Yuan, Hongyi, et al.
Pubblicazione: (2023)
di: Yuan, Hongyi, et al.
Pubblicazione: (2023)
Accelerating Unbiased LLM Evaluation via Synthetic Feedback
di: Zhou, Zhaoyi, et al.
Pubblicazione: (2025)
di: Zhou, Zhaoyi, et al.
Pubblicazione: (2025)
Accelerate Speculative Decoding with Sparse Computation in Verification
di: Wang, Jikai, et al.
Pubblicazione: (2025)
di: Wang, Jikai, et al.
Pubblicazione: (2025)
Training Language Models to Reason Efficiently
di: Arora, Daman, et al.
Pubblicazione: (2025)
di: Arora, Daman, et al.
Pubblicazione: (2025)
Speculative Pipeline Decoding: Higher-Accruacy and Zero-Bubble Speculation via Pipeline Parallelism
di: Yu, Yijiong, et al.
Pubblicazione: (2026)
di: Yu, Yijiong, et al.
Pubblicazione: (2026)
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
di: Wang, Pei-Shuo, et al.
Pubblicazione: (2025)
di: Wang, Pei-Shuo, et al.
Pubblicazione: (2025)
Faster Cascades via Speculative Decoding
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
Traversal Verification for Speculative Tree Decoding
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
Scaling Laws for Speculative Decoding
di: Yan, Siyuan, et al.
Pubblicazione: (2025)
di: Yan, Siyuan, et al.
Pubblicazione: (2025)
Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
Temperature-Centric Investigation of Speculative Decoding with Knowledge Distillation
di: Ouyang, Siru, et al.
Pubblicazione: (2024)
di: Ouyang, Siru, et al.
Pubblicazione: (2024)
TALON: Confidence-Aware Speculative Decoding with Adaptive Token Trees
di: Liu, Tianyu, et al.
Pubblicazione: (2026)
di: Liu, Tianyu, et al.
Pubblicazione: (2026)
3-Model Speculative Decoding
di: Byun, Sanghyun, et al.
Pubblicazione: (2025)
di: Byun, Sanghyun, et al.
Pubblicazione: (2025)
SEED: Accelerating Reasoning Tree Construction via Scheduled Speculative Decoding
di: Wang, Zhenglin, et al.
Pubblicazione: (2024)
di: Wang, Zhenglin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Theoretical Perspective for Speculative Decoding Algorithm
di: Yin, Ming, et al.
Pubblicazione: (2024) -
TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
di: Sun, Hanshi, et al.
Pubblicazione: (2024) -
TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling
di: Qiu, Jiahao, et al.
Pubblicazione: (2024) -
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
di: Huang, Kaixuan, et al.
Pubblicazione: (2024) -
Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
di: Ziashahabi, Amir, et al.
Pubblicazione: (2025)