Making Every Verified Token Count: Adaptive Verification for MoE Speculative Decoding
Fuente:
arXiv
Salvato in:
| Autori principali: | Pan, Lehan, Tao, Ziyang, Pang, Ruoyu, Wang, Xiao, Zhao, Jianjun, Zhang, Yanyong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GRACE-MoE: Grouping and Replication with Locality-Aware Routing for Efficient Distributed MoE Inference
di: Han, Yu, et al.
Pubblicazione: (2025)
di: Han, Yu, et al.
Pubblicazione: (2025)
Make Every Draft Count: Hidden State based Speculative Decoding
di: Chen, Yuetao, et al.
Pubblicazione: (2026)
di: Chen, Yuetao, et al.
Pubblicazione: (2026)
Hybrid Verified Decoding: Learning to Allocate Verification in Speculative Decoding
di: Su, Xin, et al.
Pubblicazione: (2026)
di: Su, Xin, et al.
Pubblicazione: (2026)
Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
TALON: Confidence-Aware Speculative Decoding with Adaptive Token Trees
di: Liu, Tianyu, et al.
Pubblicazione: (2026)
di: Liu, Tianyu, et al.
Pubblicazione: (2026)
Make Every Penny Count: Difficulty-Adaptive Self-Consistency for Cost-Efficient Reasoning
di: Wang, Xinglin, et al.
Pubblicazione: (2024)
di: Wang, Xinglin, et al.
Pubblicazione: (2024)
Accelerate Speculative Decoding with Sparse Computation in Verification
di: Wang, Jikai, et al.
Pubblicazione: (2025)
di: Wang, Jikai, et al.
Pubblicazione: (2025)
MoE-SpAc: Efficient MoE Inference Based on Speculative Activation Utility in Heterogeneous Edge Scenarios
di: Li, Shuhuai, et al.
Pubblicazione: (2026)
di: Li, Shuhuai, et al.
Pubblicazione: (2026)
From Tokens to Steps: Verification-Aware Speculative Decoding for Efficient Multi-Step Reasoning
di: Purohit, Kiran, et al.
Pubblicazione: (2026)
di: Purohit, Kiran, et al.
Pubblicazione: (2026)
Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding
di: Kim, Sungkyun, et al.
Pubblicazione: (2025)
di: Kim, Sungkyun, et al.
Pubblicazione: (2025)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
di: Yang, Penghui, et al.
Pubblicazione: (2025)
di: Yang, Penghui, et al.
Pubblicazione: (2025)
Pangu Ultra MoE: How to Train Your Big MoE on Ascend NPUs
di: Tang, Yehui, et al.
Pubblicazione: (2025)
di: Tang, Yehui, et al.
Pubblicazione: (2025)
GRIFFIN: Effective Token Alignment for Faster Speculative Decoding
di: Hu, Shijing, et al.
Pubblicazione: (2025)
di: Hu, Shijing, et al.
Pubblicazione: (2025)
Alignment-Augmented Speculative Decoding with Alignment Sampling and Conditional Verification
di: Wang, Jikai, et al.
Pubblicazione: (2025)
di: Wang, Jikai, et al.
Pubblicazione: (2025)
SP-MoE: Speculative Decoding and Prefetching for Accelerating MoE-based Model Inference
di: Chen, Liangkun, et al.
Pubblicazione: (2025)
di: Chen, Liangkun, et al.
Pubblicazione: (2025)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
di: Ji, Yicheng, et al.
Pubblicazione: (2025)
di: Ji, Yicheng, et al.
Pubblicazione: (2025)
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
di: Liu, Chengbo, et al.
Pubblicazione: (2024)
di: Liu, Chengbo, et al.
Pubblicazione: (2024)
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
di: Liu, Tianyu, et al.
Pubblicazione: (2025)
di: Liu, Tianyu, et al.
Pubblicazione: (2025)
Traversal Verification for Speculative Tree Decoding
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning
di: Tang, Jun-Tao, et al.
Pubblicazione: (2026)
di: Tang, Jun-Tao, et al.
Pubblicazione: (2026)
Token-Driven GammaTune: Adaptive Calibration for Enhanced Speculative Decoding
di: Gautam, Aayush, et al.
Pubblicazione: (2025)
di: Gautam, Aayush, et al.
Pubblicazione: (2025)
Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts
di: Wu, Haoyuan, et al.
Pubblicazione: (2025)
di: Wu, Haoyuan, et al.
Pubblicazione: (2025)
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
di: Qian, Yulei, et al.
Pubblicazione: (2024)
di: Qian, Yulei, et al.
Pubblicazione: (2024)
Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs
di: Li, Qi, et al.
Pubblicazione: (2025)
di: Li, Qi, et al.
Pubblicazione: (2025)
LLaDA-MoE: A Sparse MoE Diffusion Language Model
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
Block Verification Accelerates Speculative Decoding
di: Sun, Ziteng, et al.
Pubblicazione: (2024)
di: Sun, Ziteng, et al.
Pubblicazione: (2024)
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
di: Liu, Tianyu, et al.
Pubblicazione: (2024)
di: Liu, Tianyu, et al.
Pubblicazione: (2024)
Mixture of Tokens: Continuous MoE through Cross-Example Aggregation
di: Antoniak, Szymon, et al.
Pubblicazione: (2023)
di: Antoniak, Szymon, et al.
Pubblicazione: (2023)
Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding
di: Zhang, Jun, et al.
Pubblicazione: (2023)
di: Zhang, Jun, et al.
Pubblicazione: (2023)
Expert-Token Resonance MoE: Bidirectional Routing with Efficiency Affinity-Driven Active Selection
di: Li, Jing, et al.
Pubblicazione: (2024)
di: Li, Jing, et al.
Pubblicazione: (2024)
Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning
di: Zhang, Jiebin, et al.
Pubblicazione: (2026)
di: Zhang, Jiebin, et al.
Pubblicazione: (2026)
MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE
di: Huang, Zongle, et al.
Pubblicazione: (2025)
di: Huang, Zongle, et al.
Pubblicazione: (2025)
OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure
di: Wang, Jikai, et al.
Pubblicazione: (2024)
di: Wang, Jikai, et al.
Pubblicazione: (2024)
MoE-Spec: Expert Budgeting for Efficient Speculative Decoding
di: McDanel, Bradley, et al.
Pubblicazione: (2026)
di: McDanel, Bradley, et al.
Pubblicazione: (2026)
PACER: Blockwise Pre-verification for Speculative Decoding with Adaptive Length
di: Zhang, Situo, et al.
Pubblicazione: (2026)
di: Zhang, Situo, et al.
Pubblicazione: (2026)
Training Report of TeleChat3-MoE
di: Liu, Xinzhang, et al.
Pubblicazione: (2025)
di: Liu, Xinzhang, et al.
Pubblicazione: (2025)
TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
di: Xiao, Sibo, et al.
Pubblicazione: (2025)
di: Xiao, Sibo, et al.
Pubblicazione: (2025)
Graph-Structured Speculative Decoding
di: Gong, Zhuocheng, et al.
Pubblicazione: (2024)
di: Gong, Zhuocheng, et al.
Pubblicazione: (2024)
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs
di: Xia, Xinfeng, et al.
Pubblicazione: (2025)
di: Xia, Xinfeng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GRACE-MoE: Grouping and Replication with Locality-Aware Routing for Efficient Distributed MoE Inference
di: Han, Yu, et al.
Pubblicazione: (2025) -
Make Every Draft Count: Hidden State based Speculative Decoding
di: Chen, Yuetao, et al.
Pubblicazione: (2026) -
Hybrid Verified Decoding: Learning to Allocate Verification in Speculative Decoding
di: Su, Xin, et al.
Pubblicazione: (2026) -
Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE
di: Huang, Haiduo, et al.
Pubblicazione: (2025) -
TALON: Confidence-Aware Speculative Decoding with Adaptive Token Trees
di: Liu, Tianyu, et al.
Pubblicazione: (2026)