DMax: Aggressive Parallel Decoding for dLLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Zigeng, Fang, Gongfan, Ma, Xinyin, Yu, Ruonan, Wang, Xinchao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
dParallel: Learnable Parallel Decoding for dLLMs
par: Chen, Zigeng, et autres
Publié: (2025)
par: Chen, Zigeng, et autres
Publié: (2025)
dVoting: Fast Voting for dLLMs
par: Feng, Sicheng, et autres
Publié: (2026)
par: Feng, Sicheng, et autres
Publié: (2026)
dMoE: dLLMs with Learnable Block Experts
par: Feng, Sicheng, et autres
Publié: (2026)
par: Feng, Sicheng, et autres
Publié: (2026)
VeriThinker: Learning to Verify Makes Reasoning Model Efficient
par: Chen, Zigeng, et autres
Publié: (2025)
par: Chen, Zigeng, et autres
Publié: (2025)
AsyncDiff: Parallelizing Diffusion Models by Asynchronous Denoising
par: Chen, Zigeng, et autres
Publié: (2024)
par: Chen, Zigeng, et autres
Publié: (2024)
TinyFusion: Diffusion Transformers Learned Shallow
par: Fang, Gongfan, et autres
Publié: (2024)
par: Fang, Gongfan, et autres
Publié: (2024)
Isomorphic Pruning for Vision Models
par: Fang, Gongfan, et autres
Publié: (2024)
par: Fang, Gongfan, et autres
Publié: (2024)
Thinkless: LLM Learns When to Think
par: Fang, Gongfan, et autres
Publié: (2025)
par: Fang, Gongfan, et autres
Publié: (2025)
Collaborative Decoding Makes Visual Auto-Regressive Modeling Efficient
par: Chen, Zigeng, et autres
Publié: (2024)
par: Chen, Zigeng, et autres
Publié: (2024)
In-Video Instructions: Visual Signals as Generative Control
par: Fang, Gongfan, et autres
Publié: (2025)
par: Fang, Gongfan, et autres
Publié: (2025)
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
par: Fang, Gongfan, et autres
Publié: (2024)
par: Fang, Gongfan, et autres
Publié: (2024)
Mix-Quant: Quantized Prefilling, Precise Decoding for Agentic LLMs
par: Lu, Haiquan, et autres
Publié: (2026)
par: Lu, Haiquan, et autres
Publié: (2026)
Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
Invisible Safety Threat: Malicious Finetuning for LLM via Steganography
par: Wan, Guangnian, et autres
Publié: (2026)
par: Wan, Guangnian, et autres
Publié: (2026)
Efficient Reasoning Models: A Survey
par: Feng, Sicheng, et autres
Publié: (2025)
par: Feng, Sicheng, et autres
Publié: (2025)
LiteFocus: Accelerated Diffusion Inference for Long Audio Synthesis
par: Tan, Zhenxiong, et autres
Publié: (2024)
par: Tan, Zhenxiong, et autres
Publié: (2024)
SlimSAM: 0.1% Data Makes Segment Anything Slim
par: Chen, Zigeng, et autres
Publié: (2023)
par: Chen, Zigeng, et autres
Publié: (2023)
ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation
par: Tang, Siao, et autres
Publié: (2025)
par: Tang, Siao, et autres
Publié: (2025)
CoT-Valve: Length-Compressible Chain-of-Thought Tuning
par: Ma, Xinyin, et autres
Publié: (2025)
par: Ma, Xinyin, et autres
Publié: (2025)
MixReasoning: Switching Modes to Think
par: Lu, Haiquan, et autres
Publié: (2025)
par: Lu, Haiquan, et autres
Publié: (2025)
Learning-to-Cache: Accelerating Diffusion Transformer via Layer Caching
par: Ma, Xinyin, et autres
Publié: (2024)
par: Ma, Xinyin, et autres
Publié: (2024)
Self-Purification Mitigates Backdoors in Multimodal Diffusion Language Models
par: Wan, Guangnian, et autres
Publié: (2026)
par: Wan, Guangnian, et autres
Publié: (2026)
Bifurcated Attention: Accelerating Massively Parallel Decoding with Shared Prefixes in LLMs
par: Athiwaratkun, Ben, et autres
Publié: (2024)
par: Athiwaratkun, Ben, et autres
Publié: (2024)
MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models
par: Fang, Gongfan, et autres
Publié: (2024)
par: Fang, Gongfan, et autres
Publié: (2024)
dKV-Cache: The Cache for Diffusion Language Models
par: Ma, Xinyin, et autres
Publié: (2025)
par: Ma, Xinyin, et autres
Publié: (2025)
KAN or MLP: A Fairer Comparison
par: Yu, Runpeng, et autres
Publié: (2024)
par: Yu, Runpeng, et autres
Publié: (2024)
Discrete Diffusion in Large Language and Multimodal Models: A Survey
par: Yu, Runpeng, et autres
Publié: (2025)
par: Yu, Runpeng, et autres
Publié: (2025)
Multi-Level Collaboration in Model Merging
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
Accelerating Diffusion LLMs via Adaptive Parallel Decoding
par: Israel, Daniel, et autres
Publié: (2025)
par: Israel, Daniel, et autres
Publié: (2025)
LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning
par: Hu, Yanzhe, et autres
Publié: (2026)
par: Hu, Yanzhe, et autres
Publié: (2026)
CIRCUIT: A Benchmark for Circuit Interpretation and Reasoning Capabilities of LLMs
par: Skelic, Lejla, et autres
Publié: (2025)
par: Skelic, Lejla, et autres
Publié: (2025)
Introducing Visual Perception Token into Multimodal Large Language Model
par: Yu, Runpeng, et autres
Publié: (2025)
par: Yu, Runpeng, et autres
Publié: (2025)
Refinement Provenance Inference: Detecting LLM-Refined Training Prompts from Model Behavior
par: Yin, Bo, et autres
Publié: (2026)
par: Yin, Bo, et autres
Publié: (2026)
From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Models
par: Fu, Hengyu, et autres
Publié: (2025)
par: Fu, Hengyu, et autres
Publié: (2025)
StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel
par: Cutler, Dylan, et autres
Publié: (2025)
par: Cutler, Dylan, et autres
Publié: (2025)
MambaOut: Do We Really Need Mamba for Vision?
par: Yu, Weihao, et autres
Publié: (2024)
par: Yu, Weihao, et autres
Publié: (2024)
TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference
par: Tang, Xiaojuan, et autres
Publié: (2025)
par: Tang, Xiaojuan, et autres
Publié: (2025)
EDIT: Early Diffusion Inference Termination for dLLMs Based on Dynamics of Training Gradients
par: Hsieh, He-Yen, et autres
Publié: (2025)
par: Hsieh, He-Yen, et autres
Publié: (2025)
Conservative & Aggressive NaNs Accelerate U-Nets for Neuroimaging
par: Gonzalez-Pepe, Inés, et autres
Publié: (2026)
par: Gonzalez-Pepe, Inés, et autres
Publié: (2026)
Anomaly Detection with Adaptive and Aggressive Rejection for Contaminated Training Data
par: Lee, Jungi, et autres
Publié: (2025)
par: Lee, Jungi, et autres
Publié: (2025)
Documents similaires
-
dParallel: Learnable Parallel Decoding for dLLMs
par: Chen, Zigeng, et autres
Publié: (2025) -
dVoting: Fast Voting for dLLMs
par: Feng, Sicheng, et autres
Publié: (2026) -
dMoE: dLLMs with Learnable Block Experts
par: Feng, Sicheng, et autres
Publié: (2026) -
VeriThinker: Learning to Verify Makes Reasoning Model Efficient
par: Chen, Zigeng, et autres
Publié: (2025) -
AsyncDiff: Parallelizing Diffusion Models by Asynchronous Denoising
par: Chen, Zigeng, et autres
Publié: (2024)