DFlash: Block Diffusion for Flash Speculative Decoding
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Jian, Liang, Yesheng, Liu, Zhijian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Accelerating Speculative Decoding with Block Diffusion Draft Trees
di: Ringel, Liran, et al.
Pubblicazione: (2026)
di: Ringel, Liran, et al.
Pubblicazione: (2026)
SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting
di: Shi, Weijie, et al.
Pubblicazione: (2026)
di: Shi, Weijie, et al.
Pubblicazione: (2026)
DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding
di: Zhang, Jiebin, et al.
Pubblicazione: (2026)
di: Zhang, Jiebin, et al.
Pubblicazione: (2026)
ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference
di: Liang, Yesheng, et al.
Pubblicazione: (2025)
di: Liang, Yesheng, et al.
Pubblicazione: (2025)
FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion
di: Chen, Zhuokun, et al.
Pubblicazione: (2026)
di: Chen, Zhuokun, et al.
Pubblicazione: (2026)
Block Verification Accelerates Speculative Decoding
di: Sun, Ziteng, et al.
Pubblicazione: (2024)
di: Sun, Ziteng, et al.
Pubblicazione: (2024)
DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference
di: Liu, Fuliang, et al.
Pubblicazione: (2026)
di: Liu, Fuliang, et al.
Pubblicazione: (2026)
PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding
di: Sun, Shengyin, et al.
Pubblicazione: (2026)
di: Sun, Shengyin, et al.
Pubblicazione: (2026)
SpecTr-GBV: Multi-Draft Block Verification Accelerating Speculative Decoding
di: Lin, Yijun, et al.
Pubblicazione: (2026)
di: Lin, Yijun, et al.
Pubblicazione: (2026)
Cost-Aware Diffusion Draft Trees for Speculative Decoding
di: Zhang, Shuai, et al.
Pubblicazione: (2026)
di: Zhang, Shuai, et al.
Pubblicazione: (2026)
Speculative Decoding with a Speculative Vocabulary
di: Williams, Miles, et al.
Pubblicazione: (2026)
di: Williams, Miles, et al.
Pubblicazione: (2026)
Self Speculative Decoding for Diffusion Large Language Models
di: Gao, Yifeng, et al.
Pubblicazione: (2025)
di: Gao, Yifeng, et al.
Pubblicazione: (2025)
Multi-Candidate Speculative Decoding
di: Yang, Sen, et al.
Pubblicazione: (2024)
di: Yang, Sen, et al.
Pubblicazione: (2024)
Decoding Speculative Decoding
di: Yan, Minghao, et al.
Pubblicazione: (2024)
di: Yan, Minghao, et al.
Pubblicazione: (2024)
Graph-Structured Speculative Decoding
di: Gong, Zhuocheng, et al.
Pubblicazione: (2024)
di: Gong, Zhuocheng, et al.
Pubblicazione: (2024)
Speculative Diffusion Decoding: Accelerating Language Generation through Diffusion
di: Christopher, Jacob K, et al.
Pubblicazione: (2024)
di: Christopher, Jacob K, et al.
Pubblicazione: (2024)
Speculative Contrastive Decoding
di: Yuan, Hongyi, et al.
Pubblicazione: (2023)
di: Yuan, Hongyi, et al.
Pubblicazione: (2023)
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
di: Wang, Pei-Shuo, et al.
Pubblicazione: (2025)
di: Wang, Pei-Shuo, et al.
Pubblicazione: (2025)
DualDiffusion: A Speculative Decoding Strategy for Masked Diffusion Models
di: Goyal, Satyam, et al.
Pubblicazione: (2026)
di: Goyal, Satyam, et al.
Pubblicazione: (2026)
Speculative Decoding: Performance or Illusion?
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2025)
Scaling Laws for Speculative Decoding
di: Yan, Siyuan, et al.
Pubblicazione: (2025)
di: Yan, Siyuan, et al.
Pubblicazione: (2025)
3-Model Speculative Decoding
di: Byun, Sanghyun, et al.
Pubblicazione: (2025)
di: Byun, Sanghyun, et al.
Pubblicazione: (2025)
Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding
di: Kim, Sungkyun, et al.
Pubblicazione: (2025)
di: Kim, Sungkyun, et al.
Pubblicazione: (2025)
Block Sparse Flash Attention
di: Ohayon, Daniel, et al.
Pubblicazione: (2025)
di: Ohayon, Daniel, et al.
Pubblicazione: (2025)
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
di: Li, Guanghao, et al.
Pubblicazione: (2025)
di: Li, Guanghao, et al.
Pubblicazione: (2025)
Online Speculative Decoding
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
Factorization-Error-Free Discrete Diffusion Language Model via Speculative Decoding
di: Fang, Xun, et al.
Pubblicazione: (2026)
di: Fang, Xun, et al.
Pubblicazione: (2026)
SpecDiff-2: Scaling Diffusion Drafter Alignment For Faster Speculative Decoding
di: Sandler, Jameson, et al.
Pubblicazione: (2025)
di: Sandler, Jameson, et al.
Pubblicazione: (2025)
Speculative Decoding and Beyond: An In-Depth Survey of Techniques
di: Hu, Yunhai, et al.
Pubblicazione: (2025)
di: Hu, Yunhai, et al.
Pubblicazione: (2025)
Dynamic Speculation Lookahead Accelerates Speculative Decoding of Large Language Models
di: Mamou, Jonathan, et al.
Pubblicazione: (2024)
di: Mamou, Jonathan, et al.
Pubblicazione: (2024)
Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding
di: Chen, Zhuoming, et al.
Pubblicazione: (2024)
di: Chen, Zhuoming, et al.
Pubblicazione: (2024)
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
di: Liu, Tianyu, et al.
Pubblicazione: (2024)
di: Liu, Tianyu, et al.
Pubblicazione: (2024)
Nearest Neighbor Speculative Decoding for LLM Generation and Attribution
di: Li, Minghan, et al.
Pubblicazione: (2024)
di: Li, Minghan, et al.
Pubblicazione: (2024)
Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning
di: Zhang, Jiebin, et al.
Pubblicazione: (2026)
di: Zhang, Jiebin, et al.
Pubblicazione: (2026)
MagicDec: Breaking the Latency-Throughput Tradeoff for Long Context Generation with Speculative Decoding
di: Sadhukhan, Ranajoy, et al.
Pubblicazione: (2024)
di: Sadhukhan, Ranajoy, et al.
Pubblicazione: (2024)
Improving Multi-candidate Speculative Decoding
di: Lu, Xiaofan, et al.
Pubblicazione: (2024)
di: Lu, Xiaofan, et al.
Pubblicazione: (2024)
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
di: Liu, Tianyu, et al.
Pubblicazione: (2025)
di: Liu, Tianyu, et al.
Pubblicazione: (2025)
Tutorial Proposal: Speculative Decoding for Efficient LLM Inference
di: Xia, Heming, et al.
Pubblicazione: (2025)
di: Xia, Heming, et al.
Pubblicazione: (2025)
CLaSp: In-Context Layer Skip for Self-Speculative Decoding
di: Chen, Longze, et al.
Pubblicazione: (2025)
di: Chen, Longze, et al.
Pubblicazione: (2025)
Traversal Verification for Speculative Tree Decoding
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Accelerating Speculative Decoding with Block Diffusion Draft Trees
di: Ringel, Liran, et al.
Pubblicazione: (2026) -
SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting
di: Shi, Weijie, et al.
Pubblicazione: (2026) -
DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding
di: Zhang, Jiebin, et al.
Pubblicazione: (2026) -
ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference
di: Liang, Yesheng, et al.
Pubblicazione: (2025) -
FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion
di: Chen, Zhuokun, et al.
Pubblicazione: (2026)