Performance-Driven Policy Optimization for Speculative Decoding with Adaptive Windowing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Jie, Sun, Xing, Chen, Ruotian, Su, Jianan, Shen, Kaixin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TALON: Confidence-Aware Speculative Decoding with Adaptive Token Trees
par: Liu, Tianyu, et autres
Publié: (2026)
par: Liu, Tianyu, et autres
Publié: (2026)
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
par: Liu, Tianyu, et autres
Publié: (2025)
par: Liu, Tianyu, et autres
Publié: (2025)
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
par: Liu, Tianyu, et autres
Publié: (2024)
par: Liu, Tianyu, et autres
Publié: (2024)
OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure
par: Wang, Jikai, et autres
Publié: (2024)
par: Wang, Jikai, et autres
Publié: (2024)
Speculative Decoding: Performance or Illusion?
par: Liu, Xiaoxuan, et autres
Publié: (2025)
par: Liu, Xiaoxuan, et autres
Publié: (2025)
Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
par: Hu, Shijing, et autres
Publié: (2025)
par: Hu, Shijing, et autres
Publié: (2025)
Token-Driven GammaTune: Adaptive Calibration for Enhanced Speculative Decoding
par: Gautam, Aayush, et autres
Publié: (2025)
par: Gautam, Aayush, et autres
Publié: (2025)
Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning
par: Zhang, Jiebin, et autres
Publié: (2026)
par: Zhang, Jiebin, et autres
Publié: (2026)
OWL: Overcoming Window Length-Dependence in Speculative Decoding for Long-Context Inputs
par: Lee, Jaeseong, et autres
Publié: (2025)
par: Lee, Jaeseong, et autres
Publié: (2025)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
par: Zhang, Situo, et autres
Publié: (2024)
par: Zhang, Situo, et autres
Publié: (2024)
Temperature-Centric Investigation of Speculative Decoding with Knowledge Distillation
par: Ouyang, Siru, et autres
Publié: (2024)
par: Ouyang, Siru, et autres
Publié: (2024)
Speculative Decoding with a Speculative Vocabulary
par: Williams, Miles, et autres
Publié: (2026)
par: Williams, Miles, et autres
Publié: (2026)
Draft on the Fly: Adaptive Self-Speculative Decoding using Cosine Similarity
par: Metel, Michael R., et autres
Publié: (2024)
par: Metel, Michael R., et autres
Publié: (2024)
Multi-Candidate Speculative Decoding
par: Yang, Sen, et autres
Publié: (2024)
par: Yang, Sen, et autres
Publié: (2024)
OmniDraft: A Cross-vocabulary, Online Adaptive Drafter for On-device Speculative Decoding
par: Ramakrishnan, Ramchalam Kinattinkara, et autres
Publié: (2025)
par: Ramakrishnan, Ramchalam Kinattinkara, et autres
Publié: (2025)
Scaling Laws for Speculative Decoding
par: Yan, Siyuan, et autres
Publié: (2025)
par: Yan, Siyuan, et autres
Publié: (2025)
Decoding Speculative Decoding
par: Yan, Minghao, et autres
Publié: (2024)
par: Yan, Minghao, et autres
Publié: (2024)
PACER: Blockwise Pre-verification for Speculative Decoding with Adaptive Length
par: Zhang, Situo, et autres
Publié: (2026)
par: Zhang, Situo, et autres
Publié: (2026)
Speculative Contrastive Decoding
par: Yuan, Hongyi, et autres
Publié: (2023)
par: Yuan, Hongyi, et autres
Publié: (2023)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
par: Sun, Ryan, et autres
Publié: (2024)
par: Sun, Ryan, et autres
Publié: (2024)
AdaSD: Adaptive Speculative Decoding for Efficient Language Model Inference
par: Lu, Kuan-Wei, et autres
Publié: (2025)
par: Lu, Kuan-Wei, et autres
Publié: (2025)
DFlash: Block Diffusion for Flash Speculative Decoding
par: Chen, Jian, et autres
Publié: (2026)
par: Chen, Jian, et autres
Publié: (2026)
Hybrid Verified Decoding: Learning to Allocate Verification in Speculative Decoding
par: Su, Xin, et autres
Publié: (2026)
par: Su, Xin, et autres
Publié: (2026)
3-Model Speculative Decoding
par: Byun, Sanghyun, et autres
Publié: (2025)
par: Byun, Sanghyun, et autres
Publié: (2025)
Graph-Structured Speculative Decoding
par: Gong, Zhuocheng, et autres
Publié: (2024)
par: Gong, Zhuocheng, et autres
Publié: (2024)
RASD: Retrieval-Augmented Speculative Decoding
par: Quan, Guofeng, et autres
Publié: (2025)
par: Quan, Guofeng, et autres
Publié: (2025)
Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding
par: Kim, Sungkyun, et autres
Publié: (2025)
par: Kim, Sungkyun, et autres
Publié: (2025)
Accelerate Speculative Decoding with Sparse Computation in Verification
par: Wang, Jikai, et autres
Publié: (2025)
par: Wang, Jikai, et autres
Publié: (2025)
Efficient Adaptive Rejection Sampling for Accelerating Speculative Decoding in Large Language Models
par: Sun, Chendong, et autres
Publié: (2025)
par: Sun, Chendong, et autres
Publié: (2025)
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
par: Liu, Chengbo, et autres
Publié: (2024)
par: Liu, Chengbo, et autres
Publié: (2024)
Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding
par: Sun, Shuoyang, et autres
Publié: (2026)
par: Sun, Shuoyang, et autres
Publié: (2026)
Entropy-Aware Speculative Decoding Toward Improved LLM Reasoning
par: Su, Tiancheng, et autres
Publié: (2025)
par: Su, Tiancheng, et autres
Publié: (2025)
Traversal Verification for Speculative Tree Decoding
par: Weng, Yepeng, et autres
Publié: (2025)
par: Weng, Yepeng, et autres
Publié: (2025)
Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding
par: Xiao, Bin, et autres
Publié: (2024)
par: Xiao, Bin, et autres
Publié: (2024)
Boosting Lossless Speculative Decoding via Feature Sampling and Partial Alignment Distillation
par: Gui, Lujun, et autres
Publié: (2024)
par: Gui, Lujun, et autres
Publié: (2024)
Dynamic Speculation Lookahead Accelerates Speculative Decoding of Large Language Models
par: Mamou, Jonathan, et autres
Publié: (2024)
par: Mamou, Jonathan, et autres
Publié: (2024)
Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding
par: Chen, Zhuoming, et autres
Publié: (2024)
par: Chen, Zhuoming, et autres
Publié: (2024)
Nearest Neighbor Speculative Decoding for LLM Generation and Attribution
par: Li, Minghan, et autres
Publié: (2024)
par: Li, Minghan, et autres
Publié: (2024)
Fast Best-of-N Decoding via Speculative Rejection
par: Sun, Hanshi, et autres
Publié: (2024)
par: Sun, Hanshi, et autres
Publié: (2024)
Making Every Verified Token Count: Adaptive Verification for MoE Speculative Decoding
par: Pan, Lehan, et autres
Publié: (2026)
par: Pan, Lehan, et autres
Publié: (2026)
Documents similaires
-
TALON: Confidence-Aware Speculative Decoding with Adaptive Token Trees
par: Liu, Tianyu, et autres
Publié: (2026) -
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
par: Liu, Tianyu, et autres
Publié: (2025) -
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
par: Liu, Tianyu, et autres
Publié: (2024) -
OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure
par: Wang, Jikai, et autres
Publié: (2024) -
Speculative Decoding: Performance or Illusion?
par: Liu, Xiaoxuan, et autres
Publié: (2025)