When Drafts Evolve: Speculative Decoding Meets Online Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qian, Yu-Yang, Wu, Hao-Cong, Fu, Yichao, Zhang, Hao, Zhao, Peng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding
par: Shen, Yuhao, et autres
Publié: (2026)
par: Shen, Yuhao, et autres
Publié: (2026)
Online Speculative Decoding
par: Liu, Xiaoxuan, et autres
Publié: (2023)
par: Liu, Xiaoxuan, et autres
Publié: (2023)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
par: Wen, Zhuofan, et autres
Publié: (2024)
par: Wen, Zhuofan, et autres
Publié: (2024)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
par: Yang, Penghui, et autres
Publié: (2025)
par: Yang, Penghui, et autres
Publié: (2025)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
par: Huang, Langlin, et autres
Publié: (2025)
par: Huang, Langlin, et autres
Publié: (2025)
BubbleSpec: Turning Long-Tail Bubbles into Speculative Rollout Drafts for Synchronous Reinforcement Learning
par: Xu, Yuhang, et autres
Publié: (2026)
par: Xu, Yuhang, et autres
Publié: (2026)
BudgetDraft: Acceptance-Aware Multi-View Training for Sparse-KV Speculative Decoding
par: He, Liang, et autres
Publié: (2026)
par: He, Liang, et autres
Publié: (2026)
FastGRPO: Accelerating Policy Optimization via Concurrency-aware Speculative Decoding and Online Draft Learning
par: Zhang, Yizhou, et autres
Publié: (2025)
par: Zhang, Yizhou, et autres
Publié: (2025)
Balancing Coverage and Draft Latency in Vocabulary Trimming for Faster Speculative Decoding
par: Shoham, Ofir Ben
Publié: (2026)
par: Shoham, Ofir Ben
Publié: (2026)
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
par: Georganas, Evangelos, et autres
Publié: (2025)
par: Georganas, Evangelos, et autres
Publié: (2025)
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
par: Hong, Fenglu, et autres
Publié: (2025)
par: Hong, Fenglu, et autres
Publié: (2025)
When Linear Attention Meets Autoregressive Decoding: Towards More Effective and Efficient Linearized Large Language Models
par: You, Haoran, et autres
Publié: (2024)
par: You, Haoran, et autres
Publié: (2024)
Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design
par: Zhang, Yudi, et autres
Publié: (2025)
par: Zhang, Yudi, et autres
Publié: (2025)
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
par: Goel, Raghavv, et autres
Publié: (2024)
par: Goel, Raghavv, et autres
Publié: (2024)
MineDraft: A Framework for Batch Parallel Speculative Decoding
par: Tang, Zhenwei, et autres
Publié: (2026)
par: Tang, Zhenwei, et autres
Publié: (2026)
Make Every Draft Count: Hidden State based Speculative Decoding
par: Chen, Yuetao, et autres
Publié: (2026)
par: Chen, Yuetao, et autres
Publié: (2026)
D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting
par: Wu, Tianyu, et autres
Publié: (2026)
par: Wu, Tianyu, et autres
Publié: (2026)
When Continue Learning Meets Multimodal Large Language Model: A Survey
par: Huo, Yukang, et autres
Publié: (2025)
par: Huo, Yukang, et autres
Publié: (2025)
QSpec: Speculative Decoding with Complementary Quantization Schemes
par: Zhao, Juntao, et autres
Publié: (2024)
par: Zhao, Juntao, et autres
Publié: (2024)
Cactus: Accelerating Auto-Regressive Decoding with Constrained Acceptance Speculative Sampling
par: Hao, Yongchang, et autres
Publié: (2026)
par: Hao, Yongchang, et autres
Publié: (2026)
Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models
par: Wu, Shutong, et autres
Publié: (2025)
par: Wu, Shutong, et autres
Publié: (2025)
Agentic Unlearning: When LLM Agent Meets Machine Unlearning
par: Wang, Bin, et autres
Publié: (2026)
par: Wang, Bin, et autres
Publié: (2026)
Speculative Safety-Aware Decoding
par: Wang, Xuekang, et autres
Publié: (2025)
par: Wang, Xuekang, et autres
Publié: (2025)
Fail Fast, Win Big: Rethinking the Drafting Strategy in Speculative Decoding via Diffusion LLMs
par: Pan, Rui, et autres
Publié: (2025)
par: Pan, Rui, et autres
Publié: (2025)
PRISM: Parametrically Refactoring Inference for Speculative Sampling Draft Models
par: Wang, Xuliang, et autres
Publié: (2026)
par: Wang, Xuliang, et autres
Publié: (2026)
BanditSpec: Adaptive Speculative Decoding via Bandit Algorithms
par: Hou, Yunlong, et autres
Publié: (2025)
par: Hou, Yunlong, et autres
Publié: (2025)
STree: Speculative Tree Decoding for Hybrid State-Space Models
par: Wu, Yangchao, et autres
Publié: (2025)
par: Wu, Yangchao, et autres
Publié: (2025)
Fast Large Language Model Collaborative Decoding via Speculation
par: Fu, Jiale, et autres
Publié: (2025)
par: Fu, Jiale, et autres
Publié: (2025)
DEER: Draft with Diffusion, Verify with Autoregressive Models
par: Cheng, Zicong, et autres
Publié: (2025)
par: Cheng, Zicong, et autres
Publié: (2025)
When Graph Neural Network Meets Causality: Opportunities, Methodologies and An Outlook
par: Jiang, Wenzhao, et autres
Publié: (2023)
par: Jiang, Wenzhao, et autres
Publié: (2023)
$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts
par: Cemri, Mert, et autres
Publié: (2025)
par: Cemri, Mert, et autres
Publié: (2025)
Scaling Speculative Decoding with Lookahead Reasoning
par: Fu, Yichao, et autres
Publié: (2025)
par: Fu, Yichao, et autres
Publié: (2025)
Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptance
par: Wang, Songsheng, et autres
Publié: (2025)
par: Wang, Songsheng, et autres
Publié: (2025)
When Correct Demonstrations Hurt: Rethinking the Role of Exemplars in In-Context Learning
par: Qiu, Chenghao, et autres
Publié: (2026)
par: Qiu, Chenghao, et autres
Publié: (2026)
MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE
par: Huang, Zongle, et autres
Publié: (2025)
par: Huang, Zongle, et autres
Publié: (2025)
When Speculation Spills Secrets: Side Channels via Speculative Decoding In LLMs
par: Wei, Jiankun, et autres
Publié: (2024)
par: Wei, Jiankun, et autres
Publié: (2024)
Exploring and Improving Drafts in Blockwise Parallel Decoding
par: Kim, Taehyeon, et autres
Publié: (2024)
par: Kim, Taehyeon, et autres
Publié: (2024)
Mixture of Attentions For Speculative Decoding
par: Zimmer, Matthieu, et autres
Publié: (2024)
par: Zimmer, Matthieu, et autres
Publié: (2024)
Draft-Conditioned Constrained Decoding for Structured Generation in LLMs
par: Reddy, Avinash, et autres
Publié: (2026)
par: Reddy, Avinash, et autres
Publié: (2026)
Attention Drift: What Autoregressive Speculative Decoding Models Learn
par: Eldenk, Doğaç, et autres
Publié: (2026)
par: Eldenk, Doğaç, et autres
Publié: (2026)
Documents similaires
-
Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding
par: Shen, Yuhao, et autres
Publié: (2026) -
Online Speculative Decoding
par: Liu, Xiaoxuan, et autres
Publié: (2023) -
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
par: Wen, Zhuofan, et autres
Publié: (2024) -
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
par: Yang, Penghui, et autres
Publié: (2025) -
POSS: Position Specialist Generates Better Draft for Speculative Decoding
par: Huang, Langlin, et autres
Publié: (2025)