BudgetDraft: Acceptance-Aware Multi-View Training for Sparse-KV Speculative Decoding
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Liang, Wen, Jingbo, Zhan, Qishi, Chen, Yixiong, Cui, Kangning, Lan, Qizhen, Wang, Xilu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Draft, Verify, and Improve: Toward Training-Aware Speculative Decoding
di: Bhansali, Shrenik, et al.
Pubblicazione: (2025)
di: Bhansali, Shrenik, et al.
Pubblicazione: (2025)
Cost-Aware Diffusion Draft Trees for Speculative Decoding
di: Zhang, Shuai, et al.
Pubblicazione: (2026)
di: Zhang, Shuai, et al.
Pubblicazione: (2026)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
di: Sun, Ryan, et al.
Pubblicazione: (2024)
di: Sun, Ryan, et al.
Pubblicazione: (2024)
TAPS: Target-Aware Prefix Tree Selection for Diffusion-Drafted Speculative Decoding
di: Wang, Zhuoyu, et al.
Pubblicazione: (2026)
di: Wang, Zhuoyu, et al.
Pubblicazione: (2026)
Adaptive Signal Resuscitation: Channel-wise Post-Pruning Repair for Sparse Vision Networks
di: Zhan, Qishi, et al.
Pubblicazione: (2026)
di: Zhan, Qishi, et al.
Pubblicazione: (2026)
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
di: Hong, Fenglu, et al.
Pubblicazione: (2025)
di: Hong, Fenglu, et al.
Pubblicazione: (2025)
Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning
di: Zhang, Jiebin, et al.
Pubblicazione: (2026)
di: Zhang, Jiebin, et al.
Pubblicazione: (2026)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
di: Wen, Zhuofan, et al.
Pubblicazione: (2024)
di: Wen, Zhuofan, et al.
Pubblicazione: (2024)
Training-free Dropout Sampling for Semantic Token Acceptance in Speculative Decoding
di: Lee, Jeongtae, et al.
Pubblicazione: (2026)
di: Lee, Jeongtae, et al.
Pubblicazione: (2026)
DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation
di: Liu, Zining, et al.
Pubblicazione: (2026)
di: Liu, Zining, et al.
Pubblicazione: (2026)
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
DuoDecoding: Hardware-aware Heterogeneous Speculative Decoding with Dynamic Multi-Sequence Drafting
di: Lv, Kai, et al.
Pubblicazione: (2025)
di: Lv, Kai, et al.
Pubblicazione: (2025)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
di: Zhang, Situo, et al.
Pubblicazione: (2024)
di: Zhang, Situo, et al.
Pubblicazione: (2024)
SpecKV: Adaptive Speculative Decoding with Compression-Aware Gamma Selection
di: Shukla, Shikhar
Pubblicazione: (2026)
di: Shukla, Shikhar
Pubblicazione: (2026)
Draft Model Knows When to Stop: Self-Verification Speculative Decoding for Long-Form Generation
di: Zhang, Ziyin, et al.
Pubblicazione: (2024)
di: Zhang, Ziyin, et al.
Pubblicazione: (2024)
FastEagle: Cascaded Drafting for Accelerating Speculative Decoding
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
di: Liu, Tianyu, et al.
Pubblicazione: (2024)
di: Liu, Tianyu, et al.
Pubblicazione: (2024)
Accelerating Speculative Decoding with Block Diffusion Draft Trees
di: Ringel, Liran, et al.
Pubblicazione: (2026)
di: Ringel, Liran, et al.
Pubblicazione: (2026)
SpecBranch: Speculative Decoding via Hybrid Drafting and Rollback-Aware Branch Parallelism
di: Shen, Yuhao, et al.
Pubblicazione: (2025)
di: Shen, Yuhao, et al.
Pubblicazione: (2025)
SpecTr-GBV: Multi-Draft Block Verification Accelerating Speculative Decoding
di: Lin, Yijun, et al.
Pubblicazione: (2026)
di: Lin, Yijun, et al.
Pubblicazione: (2026)
KOALA: Enhancing Speculative Decoding for LLM via Multi-Layer Draft Heads with Adversarial Learning
di: Zhang, Kaiqi, et al.
Pubblicazione: (2024)
di: Zhang, Kaiqi, et al.
Pubblicazione: (2024)
Draft-OPD: On-Policy Distillation for Speculative Draft Models
di: Lei, Haodi, et al.
Pubblicazione: (2026)
di: Lei, Haodi, et al.
Pubblicazione: (2026)
Draft on the Fly: Adaptive Self-Speculative Decoding using Cosine Similarity
di: Metel, Michael R., et al.
Pubblicazione: (2024)
di: Metel, Michael R., et al.
Pubblicazione: (2024)
Make Every Draft Count: Hidden State based Speculative Decoding
di: Chen, Yuetao, et al.
Pubblicazione: (2026)
di: Chen, Yuetao, et al.
Pubblicazione: (2026)
Principled Coarse-Grained Acceptance for Speculative Decoding in Speech
di: Yanuka, Moran, et al.
Pubblicazione: (2025)
di: Yanuka, Moran, et al.
Pubblicazione: (2025)
Acceptance Dynamics Across Cognitive Domains in Speculative Decoding
di: Mahmoud, Saif
Pubblicazione: (2026)
di: Mahmoud, Saif
Pubblicazione: (2026)
Training-Free Loosely Speculative Decoding: Accepting Semantically Correct Drafts Beyond Exact Match
di: Li, Jinze, et al.
Pubblicazione: (2025)
di: Li, Jinze, et al.
Pubblicazione: (2025)
TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding
di: Wu, Zhaoxuan, et al.
Pubblicazione: (2025)
di: Wu, Zhaoxuan, et al.
Pubblicazione: (2025)
OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure
di: Wang, Jikai, et al.
Pubblicazione: (2024)
di: Wang, Jikai, et al.
Pubblicazione: (2024)
MineDraft: A Framework for Batch Parallel Speculative Decoding
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
When Drafts Evolve: Speculative Decoding Meets Online Learning
di: Qian, Yu-Yang, et al.
Pubblicazione: (2026)
di: Qian, Yu-Yang, et al.
Pubblicazione: (2026)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
di: Huang, Langlin, et al.
Pubblicazione: (2025)
di: Huang, Langlin, et al.
Pubblicazione: (2025)
Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding
di: Shen, Yuhao, et al.
Pubblicazione: (2026)
di: Shen, Yuhao, et al.
Pubblicazione: (2026)
SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting
di: Shi, Weijie, et al.
Pubblicazione: (2026)
di: Shi, Weijie, et al.
Pubblicazione: (2026)
AdaEDL: Early Draft Stopping for Speculative Decoding of Large Language Models via an Entropy-based Lower Bound on Token Acceptance Probability
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2024)
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2024)
Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
di: Hu, Shijing, et al.
Pubblicazione: (2025)
di: Hu, Shijing, et al.
Pubblicazione: (2025)
Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative Decoding
di: Zhao, Weilin, et al.
Pubblicazione: (2024)
di: Zhao, Weilin, et al.
Pubblicazione: (2024)
Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding
di: Huang, Jianuo, et al.
Pubblicazione: (2026)
di: Huang, Jianuo, et al.
Pubblicazione: (2026)
Self-Speculative Decoding for LLM-based ASR with CTC Encoder Drafts
di: Saon, George, et al.
Pubblicazione: (2026)
di: Saon, George, et al.
Pubblicazione: (2026)
Balancing Coverage and Draft Latency in Vocabulary Trimming for Faster Speculative Decoding
di: Shoham, Ofir Ben
Pubblicazione: (2026)
di: Shoham, Ofir Ben
Pubblicazione: (2026)
Documenti analoghi
-
Draft, Verify, and Improve: Toward Training-Aware Speculative Decoding
di: Bhansali, Shrenik, et al.
Pubblicazione: (2025) -
Cost-Aware Diffusion Draft Trees for Speculative Decoding
di: Zhang, Shuai, et al.
Pubblicazione: (2026) -
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
di: Sun, Ryan, et al.
Pubblicazione: (2024) -
TAPS: Target-Aware Prefix Tree Selection for Diffusion-Drafted Speculative Decoding
di: Wang, Zhuoyu, et al.
Pubblicazione: (2026) -
Adaptive Signal Resuscitation: Channel-wise Post-Pruning Repair for Sparse Vision Networks
di: Zhan, Qishi, et al.
Pubblicazione: (2026)