AdaEDL: Early Draft Stopping for Speculative Decoding of Large Language Models via an Entropy-based Lower Bound on Token Acceptance Probability
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Agrawal, Sudhanshu, Jeon, Wonseok, Lee, Mingu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
par: Goel, Raghavv, et autres
Publié: (2024)
par: Goel, Raghavv, et autres
Publié: (2024)
On Speculative Decoding for Multimodal Large Language Models
par: Gagrani, Mukul, et autres
Publié: (2024)
par: Gagrani, Mukul, et autres
Publié: (2024)
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
par: Agrawal, Sudhanshu, et autres
Publié: (2025)
par: Agrawal, Sudhanshu, et autres
Publié: (2025)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
par: Zhang, Situo, et autres
Publié: (2024)
par: Zhang, Situo, et autres
Publié: (2024)
Training-free Dropout Sampling for Semantic Token Acceptance in Speculative Decoding
par: Lee, Jeongtae, et autres
Publié: (2026)
par: Lee, Jeongtae, et autres
Publié: (2026)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
par: Goel, Raghavv, et autres
Publié: (2025)
par: Goel, Raghavv, et autres
Publié: (2025)
Recursive Speculative Decoding: Accelerating LLM Inference via Sampling Without Replacement
par: Jeon, Wonseok, et autres
Publié: (2024)
par: Jeon, Wonseok, et autres
Publié: (2024)
TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding
par: Wu, Zhaoxuan, et autres
Publié: (2025)
par: Wu, Zhaoxuan, et autres
Publié: (2025)
Lossless Acceleration of Large Language Models with Hierarchical Drafting based on Temporal Locality in Speculative Decoding
par: Cho, Sukmin, et autres
Publié: (2025)
par: Cho, Sukmin, et autres
Publié: (2025)
Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding
par: Zhang, Jun, et autres
Publié: (2023)
par: Zhang, Jun, et autres
Publié: (2023)
Model-free Speculative Decoding for Transformer-based ASR with Token Map Drafting
par: Ho, Tuan Vu, et autres
Publié: (2025)
par: Ho, Tuan Vu, et autres
Publié: (2025)
Draft Model Knows When to Stop: Self-Verification Speculative Decoding for Long-Form Generation
par: Zhang, Ziyin, et autres
Publié: (2024)
par: Zhang, Ziyin, et autres
Publié: (2024)
AdaSD: Adaptive Speculative Decoding for Efficient Language Model Inference
par: Lu, Kuan-Wei, et autres
Publié: (2025)
par: Lu, Kuan-Wei, et autres
Publié: (2025)
AdaSpec: Adaptive Speculative Decoding for Fast, SLO-Aware Large Language Model Serving
par: Huang, Kaiyu, et autres
Publié: (2025)
par: Huang, Kaiyu, et autres
Publié: (2025)
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
par: Liu, Tianyu, et autres
Publié: (2024)
par: Liu, Tianyu, et autres
Publié: (2024)
Cost-Aware Diffusion Draft Trees for Speculative Decoding
par: Zhang, Shuai, et autres
Publié: (2026)
par: Zhang, Shuai, et autres
Publié: (2026)
Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning
par: Zhang, Jiebin, et autres
Publié: (2026)
par: Zhang, Jiebin, et autres
Publié: (2026)
Accelerating Speculative Decoding with Block Diffusion Draft Trees
par: Ringel, Liran, et autres
Publié: (2026)
par: Ringel, Liran, et autres
Publié: (2026)
DREAM: Drafting with Refined Target Features and Entropy-Adaptive Cross-Attention Fusion for Multimodal Speculative Decoding
par: Hu, Yunhai, et autres
Publié: (2025)
par: Hu, Yunhai, et autres
Publié: (2025)
Speculative Decoding Speed-of-Light: Optimal Lower Bounds via Branching Random Walks
par: Pankratov, Sergey, et autres
Publié: (2025)
par: Pankratov, Sergey, et autres
Publié: (2025)
Flatter Tokens are More Valuable for Speculative Draft Model Training
par: Fan, Jiaming, et autres
Publié: (2026)
par: Fan, Jiaming, et autres
Publié: (2026)
OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure
par: Wang, Jikai, et autres
Publié: (2024)
par: Wang, Jikai, et autres
Publié: (2024)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
par: Wen, Zhuofan, et autres
Publié: (2024)
par: Wen, Zhuofan, et autres
Publié: (2024)
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
par: Liu, Tianyu, et autres
Publié: (2025)
par: Liu, Tianyu, et autres
Publié: (2025)
TABED: Test-Time Adaptive Ensemble Drafting for Robust Speculative Decoding in LVLMs
par: Lee, Minjae, et autres
Publié: (2026)
par: Lee, Minjae, et autres
Publié: (2026)
FlexDraft: Flexible Speculative Decoding via Attention Tuning and Bonus-Guided Calibration
par: Zhang, Yaojie, et autres
Publié: (2026)
par: Zhang, Yaojie, et autres
Publié: (2026)
A Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMs
par: Goel, Raghavv, et autres
Publié: (2026)
par: Goel, Raghavv, et autres
Publié: (2026)
Acceptance Dynamics Across Cognitive Domains in Speculative Decoding
par: Mahmoud, Saif
Publié: (2026)
par: Mahmoud, Saif
Publié: (2026)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
par: Sun, Ryan, et autres
Publié: (2024)
par: Sun, Ryan, et autres
Publié: (2024)
DuoDecoding: Hardware-aware Heterogeneous Speculative Decoding with Dynamic Multi-Sequence Drafting
par: Lv, Kai, et autres
Publié: (2025)
par: Lv, Kai, et autres
Publié: (2025)
Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative Decoding
par: Zhao, Weilin, et autres
Publié: (2024)
par: Zhao, Weilin, et autres
Publié: (2024)
SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting
par: Shi, Weijie, et autres
Publié: (2026)
par: Shi, Weijie, et autres
Publié: (2026)
Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding
par: Huang, Jianuo, et autres
Publié: (2026)
par: Huang, Jianuo, et autres
Publié: (2026)
Draft on the Fly: Adaptive Self-Speculative Decoding using Cosine Similarity
par: Metel, Michael R., et autres
Publié: (2024)
par: Metel, Michael R., et autres
Publié: (2024)
DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding
par: Zhang, Jiebin, et autres
Publié: (2026)
par: Zhang, Jiebin, et autres
Publié: (2026)
Make Every Draft Count: Hidden State based Speculative Decoding
par: Chen, Yuetao, et autres
Publié: (2026)
par: Chen, Yuetao, et autres
Publié: (2026)
KOALA: Enhancing Speculative Decoding for LLM via Multi-Layer Draft Heads with Adversarial Learning
par: Zhang, Kaiqi, et autres
Publié: (2024)
par: Zhang, Kaiqi, et autres
Publié: (2024)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
par: Huang, Langlin, et autres
Publié: (2025)
par: Huang, Langlin, et autres
Publié: (2025)
Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
par: Hu, Shijing, et autres
Publié: (2025)
par: Hu, Shijing, et autres
Publié: (2025)
Draft-OPD: On-Policy Distillation for Speculative Draft Models
par: Lei, Haodi, et autres
Publié: (2026)
par: Lei, Haodi, et autres
Publié: (2026)
Documents similaires
-
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
par: Goel, Raghavv, et autres
Publié: (2024) -
On Speculative Decoding for Multimodal Large Language Models
par: Gagrani, Mukul, et autres
Publié: (2024) -
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
par: Agrawal, Sudhanshu, et autres
Publié: (2025) -
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
par: Zhang, Situo, et autres
Publié: (2024) -
Training-free Dropout Sampling for Semantic Token Acceptance in Speculative Decoding
par: Lee, Jeongtae, et autres
Publié: (2026)