LoPA: Scaling dLLM Inference via Lookahead Parallel Decoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Chenkai, Jin, Yijie, Li, Jiajun, Tu, Yi, Long, Guoping, Tu, Dandan, Song, Mingcong, Si, Hongjie, Hou, Tianqi, Yan, Junchi, Deng, Zhijie |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LEAP: Unlocking dLLM Parallelism via Lookahead Early-Convergence Token Detection
par: Zhang, Haohui, et autres
Publié: (2026)
par: Zhang, Haohui, et autres
Publié: (2026)
Scaling Speculative Decoding with Lookahead Reasoning
par: Fu, Yichao, et autres
Publié: (2025)
par: Fu, Yichao, et autres
Publié: (2025)
Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding
par: Wu, Chengyue, et autres
Publié: (2025)
par: Wu, Chengyue, et autres
Publié: (2025)
Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing
par: Wang, Xu, et autres
Publié: (2025)
par: Wang, Xu, et autres
Publié: (2025)
UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding
par: Xu, Chenkai, et autres
Publié: (2025)
par: Xu, Chenkai, et autres
Publié: (2025)
Tackling the Dynamicity in a Production LLM Serving System with SOTA Optimizations via Hybrid Prefill/Decode/Verify Scheduling on Efficient Meta-kernels
par: Song, Mingcong, et autres
Publié: (2024)
par: Song, Mingcong, et autres
Publié: (2024)
LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning
par: Hu, Yanzhe, et autres
Publié: (2026)
par: Hu, Yanzhe, et autres
Publié: (2026)
Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding
par: Xiao, Zhongyu, et autres
Publié: (2026)
par: Xiao, Zhongyu, et autres
Publié: (2026)
Break the Sequential Dependency of LLM Inference Using Lookahead Decoding
par: Fu, Yichao, et autres
Publié: (2024)
par: Fu, Yichao, et autres
Publié: (2024)
Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
par: Long, Lingkun, et autres
Publié: (2026)
par: Long, Lingkun, et autres
Publié: (2026)
dLLM: Simple Diffusion Language Modeling
par: Zhou, Zhanhui, et autres
Publié: (2026)
par: Zhou, Zhanhui, et autres
Publié: (2026)
ES-dLLM: Efficient Inference for Diffusion Large Language Models by Early-Skipping
par: Zhu, Zijian, et autres
Publié: (2026)
par: Zhu, Zijian, et autres
Publié: (2026)
Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM Inference
par: Huang, Jianuo, et autres
Publié: (2025)
par: Huang, Jianuo, et autres
Publié: (2025)
Constrained Decoding with Speculative Lookaheads
par: Nakshatri, Nishanth, et autres
Publié: (2024)
par: Nakshatri, Nishanth, et autres
Publié: (2024)
DeepPrune: Parallel Scaling without Inter-trace Redundancy
par: Tu, Shangqing, et autres
Publié: (2025)
par: Tu, Shangqing, et autres
Publié: (2025)
Advancing Text-to-3D Generation with Linearized Lookahead Variational Score Distillation
par: Lei, Yu, et autres
Publié: (2025)
par: Lei, Yu, et autres
Publié: (2025)
AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size
par: Lu, Guanxi, et autres
Publié: (2025)
par: Lu, Guanxi, et autres
Publié: (2025)
Up to 36x Speedup: Mask-based Parallel Inference Paradigm for Key Information Extraction in MLLMs
par: Wang, Xinzhong, et autres
Publié: (2026)
par: Wang, Xinzhong, et autres
Publié: (2026)
Fast-dLLM v2: Efficient Block-Diffusion LLM
par: Wu, Chengyue, et autres
Publié: (2025)
par: Wu, Chengyue, et autres
Publié: (2025)
Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction
par: Song, Yuerong, et autres
Publié: (2025)
par: Song, Yuerong, et autres
Publié: (2025)
dParallel: Learnable Parallel Decoding for dLLMs
par: Chen, Zigeng, et autres
Publié: (2025)
par: Chen, Zigeng, et autres
Publié: (2025)
dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching
par: Liu, Zhiyuan, et autres
Publié: (2025)
par: Liu, Zhiyuan, et autres
Publié: (2025)
Elastic-dLLM: Position Preserving Context Compression and Augmentation of Diffusion LLMs
par: Wu, Junyi, et autres
Publié: (2026)
par: Wu, Junyi, et autres
Publié: (2026)
Scene-Aware Memory Discrimination: Deciding Which Personal Knowledge Stays
par: Zhong, Yijie, et autres
Publié: (2026)
par: Zhong, Yijie, et autres
Publié: (2026)
In-context KV-Cache Eviction for LLMs via Attention-Gate
par: Zeng, Zihao, et autres
Publié: (2024)
par: Zeng, Zihao, et autres
Publié: (2024)
Fast and Accurate Causal Parallel Decoding using Jacobi Forcing
par: Hu, Lanxiang, et autres
Publié: (2025)
par: Hu, Lanxiang, et autres
Publié: (2025)
dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition
par: Tian, Wenjie, et autres
Publié: (2026)
par: Tian, Wenjie, et autres
Publié: (2026)
Adaptive Prototype Model for Attribute-based Multi-label Few-shot Action Recognition
par: Xiao, Juefeng, et autres
Publié: (2025)
par: Xiao, Juefeng, et autres
Publié: (2025)
Lookahead Unmasking Elicits Accurate Decoding in Diffusion Language Models
par: Lee, Sanghyun, et autres
Publié: (2025)
par: Lee, Sanghyun, et autres
Publié: (2025)
LINOCS: Lookahead Inference of Networked Operators for Continuous Stability
par: Mudrik, Noga, et autres
Publié: (2024)
par: Mudrik, Noga, et autres
Publié: (2024)
Lightning Fast Caching-based Parallel Denoising Prediction for Accelerating Talking Head Generation
par: Long, Jianzhi, et autres
Publié: (2025)
par: Long, Jianzhi, et autres
Publié: (2025)
Dynamic Speculation Lookahead Accelerates Speculative Decoding of Large Language Models
par: Mamou, Jonathan, et autres
Publié: (2024)
par: Mamou, Jonathan, et autres
Publié: (2024)
Sample-Efficient "Clustering and Conquer" Procedures for Parallel Large-Scale Ranking and Selection
par: Zhang, Zishi, et autres
Publié: (2024)
par: Zhang, Zishi, et autres
Publié: (2024)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
par: Zhang, Tianao, et autres
Publié: (2025)
par: Zhang, Tianao, et autres
Publié: (2025)
DMax: Aggressive Parallel Decoding for dLLMs
par: Chen, Zigeng, et autres
Publié: (2026)
par: Chen, Zigeng, et autres
Publié: (2026)
Parallel Continuous Chain-of-Thought with Jacobi Iteration
par: Wu, Haoyi, et autres
Publié: (2025)
par: Wu, Haoyi, et autres
Publié: (2025)
Staleness-Centric Optimizations for Parallel Diffusion MoE Inference
par: Luo, Jiajun, et autres
Publié: (2024)
par: Luo, Jiajun, et autres
Publié: (2024)
TeleRAG: Efficient Retrieval-Augmented Generation Inference with Lookahead Retrieval
par: Lin, Chien-Yu, et autres
Publié: (2025)
par: Lin, Chien-Yu, et autres
Publié: (2025)
$R^2$-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy Reduction
par: Du, Zhenbang, et autres
Publié: (2026)
par: Du, Zhenbang, et autres
Publié: (2026)
Accelerating Transformer Inference for Translation via Parallel Decoding
par: Santilli, Andrea, et autres
Publié: (2023)
par: Santilli, Andrea, et autres
Publié: (2023)
Documents similaires
-
LEAP: Unlocking dLLM Parallelism via Lookahead Early-Convergence Token Detection
par: Zhang, Haohui, et autres
Publié: (2026) -
Scaling Speculative Decoding with Lookahead Reasoning
par: Fu, Yichao, et autres
Publié: (2025) -
Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding
par: Wu, Chengyue, et autres
Publié: (2025) -
Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing
par: Wang, Xu, et autres
Publié: (2025) -
UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding
par: Xu, Chenkai, et autres
Publié: (2025)