ES-dLLM: Efficient Inference for Diffusion Large Language Models by Early-Skipping
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Zijian, Ren, Fei, Tan, Zhanhong, Ma, Kaisheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
dLLM: Simple Diffusion Language Modeling
por: Zhou, Zhanhui, et al.
Publicado: (2026)
por: Zhou, Zhanhui, et al.
Publicado: (2026)
dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching
por: Liu, Zhiyuan, et al.
Publicado: (2025)
por: Liu, Zhiyuan, et al.
Publicado: (2025)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
por: Zhang, Tianao, et al.
Publicado: (2025)
por: Zhang, Tianao, et al.
Publicado: (2025)
AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size
por: Lu, Guanxi, et al.
Publicado: (2025)
por: Lu, Guanxi, et al.
Publicado: (2025)
$R^2$-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy Reduction
por: Du, Zhenbang, et al.
Publicado: (2026)
por: Du, Zhenbang, et al.
Publicado: (2026)
LEAP: Unlocking dLLM Parallelism via Lookahead Early-Convergence Token Detection
por: Zhang, Haohui, et al.
Publicado: (2026)
por: Zhang, Haohui, et al.
Publicado: (2026)
Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding
por: Xiao, Zhongyu, et al.
Publicado: (2026)
por: Xiao, Zhongyu, et al.
Publicado: (2026)
The Surprising Effectiveness of Skip-Tuning in Diffusion Sampling
por: Ma, Jiajun, et al.
Publicado: (2024)
por: Ma, Jiajun, et al.
Publicado: (2024)
An Efficient Inference Framework for Early-exit Large Language Models
por: Miao, Ruijie, et al.
Publicado: (2024)
por: Miao, Ruijie, et al.
Publicado: (2024)
LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
por: Elhoushi, Mostafa, et al.
Publicado: (2024)
por: Elhoushi, Mostafa, et al.
Publicado: (2024)
Federated Learning with Layer Skipping: Efficient Training of Large Language Models for Healthcare NLP
por: Zhang, Lihong, et al.
Publicado: (2025)
por: Zhang, Lihong, et al.
Publicado: (2025)
Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models
por: Lu, Xudong, et al.
Publicado: (2024)
por: Lu, Xudong, et al.
Publicado: (2024)
DARE: Diffusion Language Model Activation Reuse for Efficient Inference
por: Frumkin, Natalia, et al.
Publicado: (2026)
por: Frumkin, Natalia, et al.
Publicado: (2026)
Encoder-Decoder Diffusion Language Models for Efficient Training and Inference
por: Arriola, Marianne, et al.
Publicado: (2025)
por: Arriola, Marianne, et al.
Publicado: (2025)
LLM in a flash: Efficient Large Language Model Inference with Limited Memory
por: Alizadeh, Keivan, et al.
Publicado: (2023)
por: Alizadeh, Keivan, et al.
Publicado: (2023)
Efficient Large Language Model Inference with Neural Block Linearization
por: Erdogan, Mete, et al.
Publicado: (2025)
por: Erdogan, Mete, et al.
Publicado: (2025)
Flow Score Distillation for Diverse Text-to-3D Generation
por: Yan, Runjie, et al.
Publicado: (2024)
por: Yan, Runjie, et al.
Publicado: (2024)
Automatic Calibration for Membership Inference Attack on Large Language Models
por: Zade, Saleh Zare, et al.
Publicado: (2025)
por: Zade, Saleh Zare, et al.
Publicado: (2025)
Optimal Bayesian Stopping for Efficient Inference of Consistent LLM Answers
por: Huang, Jingkai, et al.
Publicado: (2026)
por: Huang, Jingkai, et al.
Publicado: (2026)
BlockBatch: Multi-Scale Consensus Decoding for Efficient Diffusion Language Model Inference
por: Wu, Xiaoyou, et al.
Publicado: (2026)
por: Wu, Xiaoyou, et al.
Publicado: (2026)
On the Adversarial Transferability of Generalized "Skip Connections"
por: Wang, Yisen, et al.
Publicado: (2024)
por: Wang, Yisen, et al.
Publicado: (2024)
Efficient Low Rank Attention for Long-Context Inference in Large Language Models
por: Li, Tenghui, et al.
Publicado: (2025)
por: Li, Tenghui, et al.
Publicado: (2025)
dUltra: Ultra-Fast Diffusion Language Models via Reinforcement Learning
por: Chen, Shirui, et al.
Publicado: (2025)
por: Chen, Shirui, et al.
Publicado: (2025)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
por: Hu, Xing, et al.
Publicado: (2024)
por: Hu, Xing, et al.
Publicado: (2024)
Star Attention: Efficient LLM Inference over Long Sequences
por: Acharya, Shantanu, et al.
Publicado: (2024)
por: Acharya, Shantanu, et al.
Publicado: (2024)
EfficientLLM: Efficiency in Large Language Models
por: Yuan, Zhengqing, et al.
Publicado: (2025)
por: Yuan, Zhengqing, et al.
Publicado: (2025)
EE-LLM: Large-Scale Training and Inference of Early-Exit Large Language Models with 3D Parallelism
por: Chen, Yanxi, et al.
Publicado: (2023)
por: Chen, Yanxi, et al.
Publicado: (2023)
Membership Inference Attacks on Discrete Diffusion Language Models
por: Kasivelrajan, Shailesh
Publicado: (2026)
por: Kasivelrajan, Shailesh
Publicado: (2026)
Fast Inference for Augmented Large Language Models
por: Shahout, Rana, et al.
Publicado: (2024)
por: Shahout, Rana, et al.
Publicado: (2024)
Model-Distributed Inference for Large Language Models at the Edge
por: Macario, Davide, et al.
Publicado: (2025)
por: Macario, Davide, et al.
Publicado: (2025)
Efficient Inference Using Large Language Models with Limited Human Data: Fine-Tuning then Rectification
por: Wang, Lei, et al.
Publicado: (2025)
por: Wang, Lei, et al.
Publicado: (2025)
Challenges and Research Directions for Large Language Model Inference Hardware
por: Ma, Xiaoyu, et al.
Publicado: (2026)
por: Ma, Xiaoyu, et al.
Publicado: (2026)
ClimateLLM: Efficient Weather Forecasting via Frequency-Aware Large Language Models
por: Li, Shixuan, et al.
Publicado: (2025)
por: Li, Shixuan, et al.
Publicado: (2025)
AmoebaLLM: Constructing Any-Shape Large Language Models for Efficient and Instant Deployment
por: Fu, Yonggan, et al.
Publicado: (2024)
por: Fu, Yonggan, et al.
Publicado: (2024)
Evo: Autoregressive-Diffusion Large Language Models with Evolving Balance
por: Wu, Junde, et al.
Publicado: (2026)
por: Wu, Junde, et al.
Publicado: (2026)
SLaB: Sparse-Lowrank-Binary Decomposition for Efficient Large Language Models
por: Li, Ziwei, et al.
Publicado: (2026)
por: Li, Ziwei, et al.
Publicado: (2026)
Large Language Model Distilling Medication Recommendation Model
por: Liu, Qidong, et al.
Publicado: (2024)
por: Liu, Qidong, et al.
Publicado: (2024)
Membership Inference Attacks Against Fine-tuned Diffusion Language Models
por: Chen, Yuetian, et al.
Publicado: (2026)
por: Chen, Yuetian, et al.
Publicado: (2026)
From Uniform to Adaptive: General Skip-Block Mechanisms for Efficient PDE Neural Operators
por: Liu, Lei, et al.
Publicado: (2025)
por: Liu, Lei, et al.
Publicado: (2025)
eFedLLM: Efficient LLM Inference Based on Federated Learning
por: Ding, Shengwen, et al.
Publicado: (2024)
por: Ding, Shengwen, et al.
Publicado: (2024)
Ejemplares similares
-
dLLM: Simple Diffusion Language Modeling
por: Zhou, Zhanhui, et al.
Publicado: (2026) -
dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching
por: Liu, Zhiyuan, et al.
Publicado: (2025) -
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
por: Zhang, Tianao, et al.
Publicado: (2025) -
AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size
por: Lu, Guanxi, et al.
Publicado: (2025) -
$R^2$-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy Reduction
por: Du, Zhenbang, et al.
Publicado: (2026)