Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiao, Zhongyu, Hao, Zhiwei, Guo, Jianyuan, Luo, Yong, Liu, Jia, Xu, Jie, Hu, Han |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction
di: Song, Yuerong, et al.
Pubblicazione: (2025)
di: Song, Yuerong, et al.
Pubblicazione: (2025)
Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding
di: Wu, Chengyue, et al.
Pubblicazione: (2025)
di: Wu, Chengyue, et al.
Pubblicazione: (2025)
Fast-dLLM v2: Efficient Block-Diffusion LLM
di: Wu, Chengyue, et al.
Pubblicazione: (2025)
di: Wu, Chengyue, et al.
Pubblicazione: (2025)
LoPA: Scaling dLLM Inference via Lookahead Parallel Decoding
di: Xu, Chenkai, et al.
Pubblicazione: (2025)
di: Xu, Chenkai, et al.
Pubblicazione: (2025)
Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
di: Long, Lingkun, et al.
Pubblicazione: (2026)
di: Long, Lingkun, et al.
Pubblicazione: (2026)
dLLM: Simple Diffusion Language Modeling
di: Zhou, Zhanhui, et al.
Pubblicazione: (2026)
di: Zhou, Zhanhui, et al.
Pubblicazione: (2026)
dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching
di: Liu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Liu, Zhiyuan, et al.
Pubblicazione: (2025)
$R^2$-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy Reduction
di: Du, Zhenbang, et al.
Pubblicazione: (2026)
di: Du, Zhenbang, et al.
Pubblicazione: (2026)
ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language Tuning
di: Hao, Zhiwei, et al.
Pubblicazione: (2024)
di: Hao, Zhiwei, et al.
Pubblicazione: (2024)
SAM Decoding: Speculative Decoding via Suffix Automaton
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
SuffixDecoding: Extreme Speculative Decoding for Emerging AI Applications
di: Oliaro, Gabriele, et al.
Pubblicazione: (2024)
di: Oliaro, Gabriele, et al.
Pubblicazione: (2024)
Probe Pruning: Accelerating LLMs through Dynamic Pruning via Model-Probing
di: Le, Qi, et al.
Pubblicazione: (2025)
di: Le, Qi, et al.
Pubblicazione: (2025)
Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM Inference
di: Huang, Jianuo, et al.
Pubblicazione: (2025)
di: Huang, Jianuo, et al.
Pubblicazione: (2025)
SAM-DiffSR: Structure-Modulated Diffusion Model for Image Super-Resolution
di: Wang, Chengcheng, et al.
Pubblicazione: (2024)
di: Wang, Chengcheng, et al.
Pubblicazione: (2024)
Accelerating Diffusion LLMs via Adaptive Parallel Decoding
di: Israel, Daniel, et al.
Pubblicazione: (2025)
di: Israel, Daniel, et al.
Pubblicazione: (2025)
Acceleration Multiple Heads Decoding for LLM via Dynamic Tree Attention
di: Zhang, Zhendong
Pubblicazione: (2025)
di: Zhang, Zhendong
Pubblicazione: (2025)
d$^2$Cache: Accelerating Diffusion-Based LLMs via Dual Adaptive Caching
di: Jiang, Yuchu, et al.
Pubblicazione: (2025)
di: Jiang, Yuchu, et al.
Pubblicazione: (2025)
S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation
di: Han, Ligong, et al.
Pubblicazione: (2026)
di: Han, Ligong, et al.
Pubblicazione: (2026)
ASETF: A Novel Method for Jailbreak Attack on LLMs through Translate Suffix Embeddings
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
Mitigating Adversarial Attacks in LLMs through Defensive Suffix Generation
di: Kim, Minkyoung, et al.
Pubblicazione: (2024)
di: Kim, Minkyoung, et al.
Pubblicazione: (2024)
Elastic-dLLM: Position Preserving Context Compression and Augmentation of Diffusion LLMs
di: Wu, Junyi, et al.
Pubblicazione: (2026)
di: Wu, Junyi, et al.
Pubblicazione: (2026)
SlimInfer: Accelerating Long-Context LLM Inference via Dynamic Token Pruning
di: Long, Lingkun, et al.
Pubblicazione: (2025)
di: Long, Lingkun, et al.
Pubblicazione: (2025)
ScaleNet: Scaling up Pretrained Neural Networks with Incremental Parameters
di: Hao, Zhiwei, et al.
Pubblicazione: (2025)
di: Hao, Zhiwei, et al.
Pubblicazione: (2025)
DPad: Efficient Diffusion Language Models with Suffix Dropout
di: Chen, Xinhua, et al.
Pubblicazione: (2025)
di: Chen, Xinhua, et al.
Pubblicazione: (2025)
Data-efficient Large Vision Models through Sequential Autoregression
di: Guo, Jianyuan, et al.
Pubblicazione: (2024)
di: Guo, Jianyuan, et al.
Pubblicazione: (2024)
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2025)
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2025)
Accelerating Diffusion Decoders via Multi-Scale Sampling and One-Step Distillation
di: Wang, Chuhan, et al.
Pubblicazione: (2026)
di: Wang, Chuhan, et al.
Pubblicazione: (2026)
PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel
di: Yi, Jinjun, et al.
Pubblicazione: (2025)
di: Yi, Jinjun, et al.
Pubblicazione: (2025)
AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size
di: Lu, Guanxi, et al.
Pubblicazione: (2025)
di: Lu, Guanxi, et al.
Pubblicazione: (2025)
Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs
di: Han, Kai, et al.
Pubblicazione: (2024)
di: Han, Kai, et al.
Pubblicazione: (2024)
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
di: Liu, Chengbo, et al.
Pubblicazione: (2024)
di: Liu, Chengbo, et al.
Pubblicazione: (2024)
Rumor Detection by Multi-task Suffix Learning based on Time-series Dual Sentiments
di: Liu, Zhiwei, et al.
Pubblicazione: (2025)
di: Liu, Zhiwei, et al.
Pubblicazione: (2025)
Decoder-Only LLMs are Better Controllers for Diffusion Models
di: Dong, Ziyi, et al.
Pubblicazione: (2025)
di: Dong, Ziyi, et al.
Pubblicazione: (2025)
Pangu Light: Weight Re-Initialization for Pruning and Accelerating LLMs
di: Chen, Hanting, et al.
Pubblicazione: (2025)
di: Chen, Hanting, et al.
Pubblicazione: (2025)
ProPD: Dynamic Token Tree Pruning and Generation for LLM Parallel Decoding
di: Zhong, Shuzhang, et al.
Pubblicazione: (2024)
di: Zhong, Shuzhang, et al.
Pubblicazione: (2024)
LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding
di: Lin, Gang, et al.
Pubblicazione: (2026)
di: Lin, Gang, et al.
Pubblicazione: (2026)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
di: Ji, Yicheng, et al.
Pubblicazione: (2025)
di: Ji, Yicheng, et al.
Pubblicazione: (2025)
Self-Control of LLM Behaviors by Compressing Suffix Gradient into Prefix Controller
di: Cai, Min, et al.
Pubblicazione: (2024)
di: Cai, Min, et al.
Pubblicazione: (2024)
GASP: Efficient Black-Box Generation of Adversarial Suffixes for Jailbreaking LLMs
di: Basani, Advik Raj, et al.
Pubblicazione: (2024)
di: Basani, Advik Raj, et al.
Pubblicazione: (2024)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction
di: Song, Yuerong, et al.
Pubblicazione: (2025) -
Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding
di: Wu, Chengyue, et al.
Pubblicazione: (2025) -
Fast-dLLM v2: Efficient Block-Diffusion LLM
di: Wu, Chengyue, et al.
Pubblicazione: (2025) -
LoPA: Scaling dLLM Inference via Lookahead Parallel Decoding
di: Xu, Chenkai, et al.
Pubblicazione: (2025) -
Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
di: Long, Lingkun, et al.
Pubblicazione: (2026)