PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Shengyin, Li, Yiming, Liu, Renxi, Li, Xinqi, Zhen, Hui-Ling, Lin, Weizhe, Chen, Chen, Yu, Xianzhi, Yuan, Mingxuan, Ma, Chen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Revisiting Judge Decoding from First Principles via Training-Free Distributional Divergence
por: Sun, Shengyin, et al.
Publicado: (2026)
por: Sun, Shengyin, et al.
Publicado: (2026)
Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
por: Sun, Shengyin, et al.
Publicado: (2025)
por: Sun, Shengyin, et al.
Publicado: (2025)
Towards Efficient Agents: A Co-Design of Inference Architecture and System
por: Lin, Weizhe, et al.
Publicado: (2025)
por: Lin, Weizhe, et al.
Publicado: (2025)
SwiftMem: Fast Agentic Memory via Query-aware Indexing
por: Tian, Anxin, et al.
Publicado: (2026)
por: Tian, Anxin, et al.
Publicado: (2026)
Hyperbolic Contrastive Learning with Model-augmentation for Knowledge-aware Recommendation
por: Sun, Shengyin, et al.
Publicado: (2025)
por: Sun, Shengyin, et al.
Publicado: (2025)
AdaTSQ: Pushing the Pareto Frontier of Diffusion Transformers via Temporal-Sensitivity Quantization
por: Zhang, Shaoqiu, et al.
Publicado: (2026)
por: Zhang, Shaoqiu, et al.
Publicado: (2026)
TrimR: Verifier-based Training-Free Thinking Compression for Efficient Test-Time Scaling
por: Lin, Weizhe, et al.
Publicado: (2025)
por: Lin, Weizhe, et al.
Publicado: (2025)
Enhanced Pre-training of Graph Neural Networks for Million-Scale Heterogeneous Graphs
por: Sun, Shengyin, et al.
Publicado: (2025)
por: Sun, Shengyin, et al.
Publicado: (2025)
DLLM Agent: See Farther, Run Faster
por: Zhen, Huiling, et al.
Publicado: (2026)
por: Zhen, Huiling, et al.
Publicado: (2026)
What Matters For Safety Alignment?
por: Li, Xing, et al.
Publicado: (2026)
por: Li, Xing, et al.
Publicado: (2026)
SVDq: 1.25-bit and 410x Key Cache Compression for LLM Attention
por: Yankun, Hong, et al.
Publicado: (2025)
por: Yankun, Hong, et al.
Publicado: (2025)
Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization
por: Yao, Yihang, et al.
Publicado: (2026)
por: Yao, Yihang, et al.
Publicado: (2026)
IndustryEQA: Pushing the Frontiers of Embodied Question Answering in Industrial Scenarios
por: Li, Yifan, et al.
Publicado: (2025)
por: Li, Yifan, et al.
Publicado: (2025)
EasySpec: Layer-Parallel Speculative Decoding for Efficient Multi-GPU Utilization
por: Wu, Yize, et al.
Publicado: (2025)
por: Wu, Yize, et al.
Publicado: (2025)
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
por: Liu, Tianyu, et al.
Publicado: (2024)
por: Liu, Tianyu, et al.
Publicado: (2024)
OmniPSD: Layered PSD Generation with Diffusion Transformer
por: Liu, Cheng, et al.
Publicado: (2025)
por: Liu, Cheng, et al.
Publicado: (2025)
dParallel: Learnable Parallel Decoding for dLLMs
por: Chen, Zigeng, et al.
Publicado: (2025)
por: Chen, Zigeng, et al.
Publicado: (2025)
DFlash: Block Diffusion for Flash Speculative Decoding
por: Chen, Jian, et al.
Publicado: (2026)
por: Chen, Jian, et al.
Publicado: (2026)
Large Language Models as Topological Structure Enhancers for Text-Attributed Graphs
por: Sun, Shengyin, et al.
Publicado: (2023)
por: Sun, Shengyin, et al.
Publicado: (2023)
AgentCollab: A Self-Evaluation-Driven Collaboration Paradigm for Efficient LLM Agents
por: Gao, Wenbo, et al.
Publicado: (2026)
por: Gao, Wenbo, et al.
Publicado: (2026)
Nearest Neighbor Speculative Decoding for LLM Generation and Attribution
por: Li, Minghan, et al.
Publicado: (2024)
por: Li, Minghan, et al.
Publicado: (2024)
DMax: Aggressive Parallel Decoding for dLLMs
por: Chen, Zigeng, et al.
Publicado: (2026)
por: Chen, Zigeng, et al.
Publicado: (2026)
Speculative Pipeline Decoding: Higher-Accruacy and Zero-Bubble Speculation via Pipeline Parallelism
por: Yu, Yijiong, et al.
Publicado: (2026)
por: Yu, Yijiong, et al.
Publicado: (2026)
SpecExec: Massively Parallel Speculative Decoding for Interactive LLM Inference on Consumer Devices
por: Svirschevski, Ruslan, et al.
Publicado: (2024)
por: Svirschevski, Ruslan, et al.
Publicado: (2024)
FocuSFT: Bilevel Optimization for Dilution-Aware Long-Context Fine-Tuning
por: Pei, Zehua, et al.
Publicado: (2026)
por: Pei, Zehua, et al.
Publicado: (2026)
From Pruning to Grafting: Dynamic Knowledge Redistribution via Learnable Layer Fusion
por: Pei, Zehua, et al.
Publicado: (2024)
por: Pei, Zehua, et al.
Publicado: (2024)
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
por: Xiao, Zilin, et al.
Publicado: (2024)
por: Xiao, Zilin, et al.
Publicado: (2024)
Fail Fast, Win Big: Rethinking the Drafting Strategy in Speculative Decoding via Diffusion LLMs
por: Pan, Rui, et al.
Publicado: (2025)
por: Pan, Rui, et al.
Publicado: (2025)
TS-DP: Reinforcement Speculative Decoding For Temporal Adaptive Diffusion Policy Acceleration
por: Li, Ye, et al.
Publicado: (2025)
por: Li, Ye, et al.
Publicado: (2025)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
por: Ji, Yicheng, et al.
Publicado: (2025)
por: Ji, Yicheng, et al.
Publicado: (2025)
MemDLM: Memory-Enhanced DLM Training
por: Pei, Zehua, et al.
Publicado: (2026)
por: Pei, Zehua, et al.
Publicado: (2026)
DeepScientist: Advancing Frontier-Pushing Scientific Findings Progressively
por: Weng, Yixuan, et al.
Publicado: (2025)
por: Weng, Yixuan, et al.
Publicado: (2025)
Behavioral Fingerprinting of Large Language Models
por: Pei, Zehua, et al.
Publicado: (2025)
por: Pei, Zehua, et al.
Publicado: (2025)
Decoding at the Speed of Thought: Harnessing Parallel Decoding of Lexical Units for LLMs
por: Sun, Chenxi, et al.
Publicado: (2024)
por: Sun, Chenxi, et al.
Publicado: (2024)
Pushing the Frontiers of Self-Distillation Prototypes Network with Dimension Regularization and Score Normalization
por: Chen, Yafeng, et al.
Publicado: (2025)
por: Chen, Yafeng, et al.
Publicado: (2025)
DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference
por: Liu, Fuliang, et al.
Publicado: (2026)
por: Liu, Fuliang, et al.
Publicado: (2026)
Unleashing Low-Bit Inference on Ascend NPUs: A Comprehensive Evaluation of HiFloat Formats
por: Zhao, Pengxiang, et al.
Publicado: (2026)
por: Zhao, Pengxiang, et al.
Publicado: (2026)
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
por: Li, Guanghao, et al.
Publicado: (2025)
por: Li, Guanghao, et al.
Publicado: (2025)
Cacheback: Speculative Decoding With Nothing But Cache
por: Ma, Zhiyao, et al.
Publicado: (2025)
por: Ma, Zhiyao, et al.
Publicado: (2025)
PASER: Post-Training Data Selection for Efficient Pruned Large Language Model Recovery
por: He, Bowei, et al.
Publicado: (2025)
por: He, Bowei, et al.
Publicado: (2025)
Ejemplares similares
-
Revisiting Judge Decoding from First Principles via Training-Free Distributional Divergence
por: Sun, Shengyin, et al.
Publicado: (2026) -
Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
por: Sun, Shengyin, et al.
Publicado: (2025) -
Towards Efficient Agents: A Co-Design of Inference Architecture and System
por: Lin, Weizhe, et al.
Publicado: (2025) -
SwiftMem: Fast Agentic Memory via Query-aware Indexing
por: Tian, Anxin, et al.
Publicado: (2026) -
Hyperbolic Contrastive Learning with Model-augmentation for Knowledge-aware Recommendation
por: Sun, Shengyin, et al.
Publicado: (2025)