AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wei, Zhepei, Chen, Wei-Lin, Zhu, Xinyu, Meng, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do LLM Evaluators Prefer Themselves for a Reason?
par: Chen, Wei-Lin, et autres
Publié: (2025)
par: Chen, Wei-Lin, et autres
Publié: (2025)
The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning
par: Zhu, Xinyu, et autres
Publié: (2025)
par: Zhu, Xinyu, et autres
Publié: (2025)
Aligning Large Language Models via Fully Self-Synthetic Data
par: Yin, Shangjian, et autres
Publié: (2025)
par: Yin, Shangjian, et autres
Publié: (2025)
InstructRAG: Instructing Retrieval-Augmented Generation via Self-Synthesized Rationales
par: Wei, Zhepei, et autres
Publié: (2024)
par: Wei, Zhepei, et autres
Publié: (2024)
AdaSD: Adaptive Speculative Decoding for Efficient Language Model Inference
par: Lu, Kuan-Wei, et autres
Publié: (2025)
par: Lu, Kuan-Wei, et autres
Publié: (2025)
AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs
par: Cui, Chengming, et autres
Publié: (2026)
par: Cui, Chengming, et autres
Publié: (2026)
AdaServe: Accelerating Multi-SLO LLM Serving with SLO-Customized Speculative Decoding
par: Li, Zikun, et autres
Publié: (2025)
par: Li, Zikun, et autres
Publié: (2025)
You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories
par: Wei, Zhepei, et autres
Publié: (2026)
par: Wei, Zhepei, et autres
Publié: (2026)
ASPD: Unlocking Adaptive Serial-Parallel Decoding by Exploring Intrinsic Parallelism in LLMs
par: Chen, Keyu, et autres
Publié: (2025)
par: Chen, Keyu, et autres
Publié: (2025)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
par: Zhang, Situo, et autres
Publié: (2024)
par: Zhang, Situo, et autres
Publié: (2024)
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
par: Liu, Chengbo, et autres
Publié: (2024)
par: Liu, Chengbo, et autres
Publié: (2024)
CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit
par: Wang, Kangyu, et autres
Publié: (2025)
par: Wang, Kangyu, et autres
Publié: (2025)
Accelerating Diffusion LLMs via Adaptive Parallel Decoding
par: Israel, Daniel, et autres
Publié: (2025)
par: Israel, Daniel, et autres
Publié: (2025)
Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding
par: Wu, Chengyue, et autres
Publié: (2025)
par: Wu, Chengyue, et autres
Publié: (2025)
Divide and Conquer: Accelerating Diffusion-Based Large Language Models via Adaptive Parallel Decoding
par: Luo, Xiangzhong, et autres
Publié: (2026)
par: Luo, Xiangzhong, et autres
Publié: (2026)
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
par: Liu, Tianyu, et autres
Publié: (2024)
par: Liu, Tianyu, et autres
Publié: (2024)
Accelerate Parallelizable Reasoning via Parallel Decoding within One Sequence
par: Yu, Yijiong
Publié: (2025)
par: Yu, Yijiong
Publié: (2025)
Lossless Acceleration of Large Language Model via Adaptive N-gram Parallel Decoding
par: Ou, Jie, et autres
Publié: (2024)
par: Ou, Jie, et autres
Publié: (2024)
Hardware-Aware Parallel Prompt Decoding for Memory-Efficient Acceleration of LLM Inference
par: Chen, Hao Mark, et autres
Publié: (2024)
par: Chen, Hao Mark, et autres
Publié: (2024)
SimpleTool: Parallel Decoding for Real-Time LLM Function Calling
par: Shi, Xiaoxin, et autres
Publié: (2026)
par: Shi, Xiaoxin, et autres
Publié: (2026)
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
par: Hu, Yuezhou, et autres
Publié: (2025)
par: Hu, Yuezhou, et autres
Publié: (2025)
Learning to Parallel: Accelerating Diffusion Large Language Models via Learnable Parallel Decoding
par: Bao, Wenrui, et autres
Publié: (2025)
par: Bao, Wenrui, et autres
Publié: (2025)
AdaCAD: Adaptively Decoding to Balance Conflicts between Contextual and Parametric Knowledge
par: Wang, Han, et autres
Publié: (2024)
par: Wang, Han, et autres
Publié: (2024)
AdaSpec: Adaptive Speculative Decoding for Fast, SLO-Aware Large Language Model Serving
par: Huang, Kaiyu, et autres
Publié: (2025)
par: Huang, Kaiyu, et autres
Publié: (2025)
LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding
par: Lin, Gang, et autres
Publié: (2026)
par: Lin, Gang, et autres
Publié: (2026)
dParallel: Learnable Parallel Decoding for dLLMs
par: Chen, Zigeng, et autres
Publié: (2025)
par: Chen, Zigeng, et autres
Publié: (2025)
Beyond Static Cropping: Layer-Adaptive Visual Localization and Decoding Enhancement
par: Zhu, Zipeng, et autres
Publié: (2026)
par: Zhu, Zipeng, et autres
Publié: (2026)
Decoding at the Speed of Thought: Harnessing Parallel Decoding of Lexical Units for LLMs
par: Sun, Chenxi, et autres
Publié: (2024)
par: Sun, Chenxi, et autres
Publié: (2024)
Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning
par: Zhang, Jiebin, et autres
Publié: (2026)
par: Zhang, Jiebin, et autres
Publié: (2026)
Accelerating Transformer Inference for Translation via Parallel Decoding
par: Santilli, Andrea, et autres
Publié: (2023)
par: Santilli, Andrea, et autres
Publié: (2023)
ProPD: Dynamic Token Tree Pruning and Generation for LLM Parallel Decoding
par: Zhong, Shuzhang, et autres
Publié: (2024)
par: Zhong, Shuzhang, et autres
Publié: (2024)
Parallel Decoding via Hidden Transfer for Lossless Large Language Model Acceleration
par: Wu, Pengfei, et autres
Publié: (2024)
par: Wu, Pengfei, et autres
Publié: (2024)
Parallel Decoder Transformer: Planner-Seeded Latent Coordination for Synchronized Parallel Decoding
par: Robbins, Logan
Publié: (2025)
par: Robbins, Logan
Publié: (2025)
SpecExec: Massively Parallel Speculative Decoding for Interactive LLM Inference on Consumer Devices
par: Svirschevski, Ruslan, et autres
Publié: (2024)
par: Svirschevski, Ruslan, et autres
Publié: (2024)
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
par: Xiao, Zilin, et autres
Publié: (2024)
par: Xiao, Zilin, et autres
Publié: (2024)
PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding
par: Sun, Shengyin, et autres
Publié: (2026)
par: Sun, Shengyin, et autres
Publié: (2026)
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
par: Xia, Heming, et autres
Publié: (2024)
par: Xia, Heming, et autres
Publié: (2024)
Copy-as-Decode: Grammar-Constrained Parallel Prefill for LLM Editing
par: Liu, Ziyang
Publié: (2026)
par: Liu, Ziyang
Publié: (2026)
TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
par: Sun, Hanshi, et autres
Publié: (2024)
par: Sun, Hanshi, et autres
Publié: (2024)
Multi-Candidate Speculative Decoding
par: Yang, Sen, et autres
Publié: (2024)
par: Yang, Sen, et autres
Publié: (2024)
Documents similaires
-
Do LLM Evaluators Prefer Themselves for a Reason?
par: Chen, Wei-Lin, et autres
Publié: (2025) -
The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning
par: Zhu, Xinyu, et autres
Publié: (2025) -
Aligning Large Language Models via Fully Self-Synthetic Data
par: Yin, Shangjian, et autres
Publié: (2025) -
InstructRAG: Instructing Retrieval-Augmented Generation via Self-Synthesized Rationales
par: Wei, Zhepei, et autres
Publié: (2024) -
AdaSD: Adaptive Speculative Decoding for Efficient Language Model Inference
par: Lu, Kuan-Wei, et autres
Publié: (2025)