Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Shutong, Zhang, Jiawei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
di: Yang, Penghui, et al.
Pubblicazione: (2025)
di: Yang, Penghui, et al.
Pubblicazione: (2025)
Exploring and Improving Drafts in Blockwise Parallel Decoding
di: Kim, Taehyeon, et al.
Pubblicazione: (2024)
di: Kim, Taehyeon, et al.
Pubblicazione: (2024)
ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
di: Li, Jia-Nan, et al.
Pubblicazione: (2025)
di: Li, Jia-Nan, et al.
Pubblicazione: (2025)
From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Models
di: Fu, Hengyu, et al.
Pubblicazione: (2025)
di: Fu, Hengyu, et al.
Pubblicazione: (2025)
CAS-Spec: Cascade Adaptive Self-Speculative Decoding for On-the-Fly Lossless Inference Acceleration of LLMs
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
Generation Meets Verification: Accelerating Large Language Model Inference with Smart Parallel Auto-Correct Decoding
di: Yi, Hanling, et al.
Pubblicazione: (2024)
di: Yi, Hanling, et al.
Pubblicazione: (2024)
Locally Coherent Parallel Decoding in Diffusion Language Models
di: Hersche, Michael, et al.
Pubblicazione: (2026)
di: Hersche, Michael, et al.
Pubblicazione: (2026)
When Drafts Evolve: Speculative Decoding Meets Online Learning
di: Qian, Yu-Yang, et al.
Pubblicazione: (2026)
di: Qian, Yu-Yang, et al.
Pubblicazione: (2026)
MineDraft: A Framework for Batch Parallel Speculative Decoding
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2025)
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2025)
DEER: Draft with Diffusion, Verify with Autoregressive Models
di: Cheng, Zicong, et al.
Pubblicazione: (2025)
di: Cheng, Zicong, et al.
Pubblicazione: (2025)
P-EAGLE: Parallel-Drafting EAGLE with Scalable Training
di: Hui, Mude, et al.
Pubblicazione: (2026)
di: Hui, Mude, et al.
Pubblicazione: (2026)
Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding
di: Shen, Yuhao, et al.
Pubblicazione: (2026)
di: Shen, Yuhao, et al.
Pubblicazione: (2026)
D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting
di: Wu, Tianyu, et al.
Pubblicazione: (2026)
di: Wu, Tianyu, et al.
Pubblicazione: (2026)
Language Models as Zero-shot Lossless Gradient Compressors: Towards General Neural Parameter Prior Models
di: Wang, Hui-Po, et al.
Pubblicazione: (2024)
di: Wang, Hui-Po, et al.
Pubblicazione: (2024)
Adaptive Draft-Verification for Efficient Large Language Model Decoding
di: Liu, Xukun, et al.
Pubblicazione: (2024)
di: Liu, Xukun, et al.
Pubblicazione: (2024)
Plan, Verify and Fill: A Structured Parallel Decoding Approach for Diffusion Language Models
di: Li, Miao, et al.
Pubblicazione: (2026)
di: Li, Miao, et al.
Pubblicazione: (2026)
DepCap: Adaptive Block-Wise Parallel Decoding for Efficient Diffusion LM Inference
di: Xia, Xiang, et al.
Pubblicazione: (2026)
di: Xia, Xiang, et al.
Pubblicazione: (2026)
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
di: Hong, Fenglu, et al.
Pubblicazione: (2025)
di: Hong, Fenglu, et al.
Pubblicazione: (2025)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
di: Wen, Zhuofan, et al.
Pubblicazione: (2024)
di: Wen, Zhuofan, et al.
Pubblicazione: (2024)
BiTA: Bi-Directional Tuning for Lossless Acceleration in Large Language Models
di: Lin, Feng, et al.
Pubblicazione: (2024)
di: Lin, Feng, et al.
Pubblicazione: (2024)
Lookahead: An Inference Acceleration Framework for Large Language Model with Lossless Generation Accuracy
di: Zhao, Yao, et al.
Pubblicazione: (2023)
di: Zhao, Yao, et al.
Pubblicazione: (2023)
Draft-Conditioned Constrained Decoding for Structured Generation in LLMs
di: Reddy, Avinash, et al.
Pubblicazione: (2026)
di: Reddy, Avinash, et al.
Pubblicazione: (2026)
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
di: Goel, Raghavv, et al.
Pubblicazione: (2024)
di: Goel, Raghavv, et al.
Pubblicazione: (2024)
BudgetDraft: Acceptance-Aware Multi-View Training for Sparse-KV Speculative Decoding
di: He, Liang, et al.
Pubblicazione: (2026)
di: He, Liang, et al.
Pubblicazione: (2026)
Reasoning on the Manifold: Bidirectional Consistency for Self-Verification in Diffusion Language Models
di: Ruan, Jiaoyang, et al.
Pubblicazione: (2026)
di: Ruan, Jiaoyang, et al.
Pubblicazione: (2026)
BlockBatch: Multi-Scale Consensus Decoding for Efficient Diffusion Language Model Inference
di: Wu, Xiaoyou, et al.
Pubblicazione: (2026)
di: Wu, Xiaoyou, et al.
Pubblicazione: (2026)
Lookahead Unmasking Elicits Accurate Decoding in Diffusion Language Models
di: Lee, Sanghyun, et al.
Pubblicazione: (2025)
di: Lee, Sanghyun, et al.
Pubblicazione: (2025)
Encoder-Decoder Diffusion Language Models for Efficient Training and Inference
di: Arriola, Marianne, et al.
Pubblicazione: (2025)
di: Arriola, Marianne, et al.
Pubblicazione: (2025)
Towards Automated Regulatory Compliance Verification in Financial Auditing with Large Language Models
di: Berger, Armin, et al.
Pubblicazione: (2025)
di: Berger, Armin, et al.
Pubblicazione: (2025)
FineZip : Pushing the Limits of Large Language Models for Practical Lossless Text Compression
di: Mittu, Fazal, et al.
Pubblicazione: (2024)
di: Mittu, Fazal, et al.
Pubblicazione: (2024)
PMKLC: Parallel Multi-Knowledge Learning-based Lossless Compression for Large-Scale Genomics Database
di: Sun, Hui, et al.
Pubblicazione: (2025)
di: Sun, Hui, et al.
Pubblicazione: (2025)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
di: Huang, Langlin, et al.
Pubblicazione: (2025)
di: Huang, Langlin, et al.
Pubblicazione: (2025)
Variation in Verification: Understanding Verification Dynamics in Large Language Models
di: Zhou, Yefan, et al.
Pubblicazione: (2025)
di: Zhou, Yefan, et al.
Pubblicazione: (2025)
WirelessLLM: Empowering Large Language Models Towards Wireless Intelligence
di: Shao, Jiawei, et al.
Pubblicazione: (2024)
di: Shao, Jiawei, et al.
Pubblicazione: (2024)
Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous Vocabularies
di: Timor, Nadav, et al.
Pubblicazione: (2025)
di: Timor, Nadav, et al.
Pubblicazione: (2025)
Lossless Vocabulary Reduction for Auto-Regressive Language Models
di: Chijiwa, Daiki, et al.
Pubblicazione: (2025)
di: Chijiwa, Daiki, et al.
Pubblicazione: (2025)
Accelerating Diffusion LLMs via Adaptive Parallel Decoding
di: Israel, Daniel, et al.
Pubblicazione: (2025)
di: Israel, Daniel, et al.
Pubblicazione: (2025)
Robust Multi-Objective Controlled Decoding of Large Language Models
di: Son, Seongho, et al.
Pubblicazione: (2025)
di: Son, Seongho, et al.
Pubblicazione: (2025)
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
di: Yang, Penghui, et al.
Pubblicazione: (2025) -
Exploring and Improving Drafts in Blockwise Parallel Decoding
di: Kim, Taehyeon, et al.
Pubblicazione: (2024) -
ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
di: Li, Jia-Nan, et al.
Pubblicazione: (2025) -
From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Models
di: Fu, Hengyu, et al.
Pubblicazione: (2025) -
CAS-Spec: Cascade Adaptive Self-Speculative Decoding for On-the-Fly Lossless Inference Acceleration of LLMs
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)