DuoDecoding: Hardware-aware Heterogeneous Speculative Decoding with Dynamic Multi-Sequence Drafting
Fuente:
arXiv
Guardado en:
| Autores principales: | Lv, Kai, Guo, Honglin, Guo, Qipeng, Qiu, Xipeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
por: Liu, Tianyu, et al.
Publicado: (2024)
por: Liu, Tianyu, et al.
Publicado: (2024)
Cost-Aware Diffusion Draft Trees for Speculative Decoding
por: Zhang, Shuai, et al.
Publicado: (2026)
por: Zhang, Shuai, et al.
Publicado: (2026)
Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding
por: Chen, Zhuoming, et al.
Publicado: (2024)
por: Chen, Zhuoming, et al.
Publicado: (2024)
SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting
por: Shi, Weijie, et al.
Publicado: (2026)
por: Shi, Weijie, et al.
Publicado: (2026)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
por: Sun, Ryan, et al.
Publicado: (2024)
por: Sun, Ryan, et al.
Publicado: (2024)
Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning
por: Zhang, Jiebin, et al.
Publicado: (2026)
por: Zhang, Jiebin, et al.
Publicado: (2026)
Accelerating Speculative Decoding with Block Diffusion Draft Trees
por: Ringel, Liran, et al.
Publicado: (2026)
por: Ringel, Liran, et al.
Publicado: (2026)
AdaLomo: Low-memory Optimization with Adaptive Learning Rate
por: Lv, Kai, et al.
Publicado: (2023)
por: Lv, Kai, et al.
Publicado: (2023)
SpecTr-GBV: Multi-Draft Block Verification Accelerating Speculative Decoding
por: Lin, Yijun, et al.
Publicado: (2026)
por: Lin, Yijun, et al.
Publicado: (2026)
OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure
por: Wang, Jikai, et al.
Publicado: (2024)
por: Wang, Jikai, et al.
Publicado: (2024)
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
por: Georganas, Evangelos, et al.
Publicado: (2025)
por: Georganas, Evangelos, et al.
Publicado: (2025)
Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative Decoding
por: Zhao, Weilin, et al.
Publicado: (2024)
por: Zhao, Weilin, et al.
Publicado: (2024)
Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding
por: Huang, Jianuo, et al.
Publicado: (2026)
por: Huang, Jianuo, et al.
Publicado: (2026)
Draft on the Fly: Adaptive Self-Speculative Decoding using Cosine Similarity
por: Metel, Michael R., et al.
Publicado: (2024)
por: Metel, Michael R., et al.
Publicado: (2024)
DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding
por: Zhang, Jiebin, et al.
Publicado: (2026)
por: Zhang, Jiebin, et al.
Publicado: (2026)
TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding
por: Wu, Zhaoxuan, et al.
Publicado: (2025)
por: Wu, Zhaoxuan, et al.
Publicado: (2025)
KOALA: Enhancing Speculative Decoding for LLM via Multi-Layer Draft Heads with Adversarial Learning
por: Zhang, Kaiqi, et al.
Publicado: (2024)
por: Zhang, Kaiqi, et al.
Publicado: (2024)
Full Parameter Fine-tuning for Large Language Models with Limited Resources
por: Lv, Kai, et al.
Publicado: (2023)
por: Lv, Kai, et al.
Publicado: (2023)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
por: Zhang, Situo, et al.
Publicado: (2024)
por: Zhang, Situo, et al.
Publicado: (2024)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
por: Huang, Langlin, et al.
Publicado: (2025)
por: Huang, Langlin, et al.
Publicado: (2025)
Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
por: Hu, Shijing, et al.
Publicado: (2025)
por: Hu, Shijing, et al.
Publicado: (2025)
MineDraft: A Framework for Batch Parallel Speculative Decoding
por: Tang, Zhenwei, et al.
Publicado: (2026)
por: Tang, Zhenwei, et al.
Publicado: (2026)
Multi-Candidate Speculative Decoding
por: Yang, Sen, et al.
Publicado: (2024)
por: Yang, Sen, et al.
Publicado: (2024)
Decoding Speculative Decoding
por: Yan, Minghao, et al.
Publicado: (2024)
por: Yan, Minghao, et al.
Publicado: (2024)
CritiQ: Mining Data Quality Criteria from Human Preferences
por: Guo, Honglin, et al.
Publicado: (2025)
por: Guo, Honglin, et al.
Publicado: (2025)
FlexDraft: Flexible Speculative Decoding via Attention Tuning and Bonus-Guided Calibration
por: Zhang, Yaojie, et al.
Publicado: (2026)
por: Zhang, Yaojie, et al.
Publicado: (2026)
Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding
por: Zhang, Jun, et al.
Publicado: (2023)
por: Zhang, Jun, et al.
Publicado: (2023)
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
por: Hong, Fenglu, et al.
Publicado: (2025)
por: Hong, Fenglu, et al.
Publicado: (2025)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
por: Wen, Zhuofan, et al.
Publicado: (2024)
por: Wen, Zhuofan, et al.
Publicado: (2024)
Balancing Coverage and Draft Latency in Vocabulary Trimming for Faster Speculative Decoding
por: Shoham, Ofir Ben
Publicado: (2026)
por: Shoham, Ofir Ben
Publicado: (2026)
TABED: Test-Time Adaptive Ensemble Drafting for Robust Speculative Decoding in LVLMs
por: Lee, Minjae, et al.
Publicado: (2026)
por: Lee, Minjae, et al.
Publicado: (2026)
SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding
por: Plaksin, Anton, et al.
Publicado: (2026)
por: Plaksin, Anton, et al.
Publicado: (2026)
Dynamic Depth Decoding: Faster Speculative Decoding for LLMs
por: Brown, Oscar, et al.
Publicado: (2024)
por: Brown, Oscar, et al.
Publicado: (2024)
Make Every Draft Count: Hidden State based Speculative Decoding
por: Chen, Yuetao, et al.
Publicado: (2026)
por: Chen, Yuetao, et al.
Publicado: (2026)
Explicit Multi-head Attention for Inter-head Interaction in Large Language Models
por: Peng, Runyu, et al.
Publicado: (2026)
por: Peng, Runyu, et al.
Publicado: (2026)
Improving Multi-candidate Speculative Decoding
por: Lu, Xiaofan, et al.
Publicado: (2024)
por: Lu, Xiaofan, et al.
Publicado: (2024)
Lossless Acceleration of Large Language Models with Hierarchical Drafting based on Temporal Locality in Speculative Decoding
por: Cho, Sukmin, et al.
Publicado: (2025)
por: Cho, Sukmin, et al.
Publicado: (2025)
Training-Free Loosely Speculative Decoding: Accepting Semantically Correct Drafts Beyond Exact Match
por: Li, Jinze, et al.
Publicado: (2025)
por: Li, Jinze, et al.
Publicado: (2025)
LongWanjuan: Towards Systematic Measurement for Long Text Quality
por: Lv, Kai, et al.
Publicado: (2024)
por: Lv, Kai, et al.
Publicado: (2024)
OmniDraft: A Cross-vocabulary, Online Adaptive Drafter for On-device Speculative Decoding
por: Ramakrishnan, Ramchalam Kinattinkara, et al.
Publicado: (2025)
por: Ramakrishnan, Ramchalam Kinattinkara, et al.
Publicado: (2025)
Ejemplares similares
-
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
por: Liu, Tianyu, et al.
Publicado: (2024) -
Cost-Aware Diffusion Draft Trees for Speculative Decoding
por: Zhang, Shuai, et al.
Publicado: (2026) -
Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding
por: Chen, Zhuoming, et al.
Publicado: (2024) -
SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting
por: Shi, Weijie, et al.
Publicado: (2026) -
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
por: Sun, Ryan, et al.
Publicado: (2024)