AdaSD: Adaptive Speculative Decoding for Efficient Language Model Inference
Fuente:
arXiv
Guardado en:
| Autores principales: | Lu, Kuan-Wei, Hong, Ding-Yong, Liu, Pangfeng, Wu, Jan-Jan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Hybrid Dual-Batch and Cyclic Progressive Learning for Efficient Distributed Training
por: Lu, Kuan-Wei, et al.
Publicado: (2025)
por: Lu, Kuan-Wei, et al.
Publicado: (2025)
EMS-SD: Efficient Multi-sample Speculative Decoding for Accelerating Large Language Models
por: Ni, Yunsheng, et al.
Publicado: (2024)
por: Ni, Yunsheng, et al.
Publicado: (2024)
AdaSpec: Adaptive Speculative Decoding for Fast, SLO-Aware Large Language Model Serving
por: Huang, Kaiyu, et al.
Publicado: (2025)
por: Huang, Kaiyu, et al.
Publicado: (2025)
DReSD: Dense Retrieval for Speculative Decoding
por: Gritta, Milan, et al.
Publicado: (2025)
por: Gritta, Milan, et al.
Publicado: (2025)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
por: Zhang, Situo, et al.
Publicado: (2024)
por: Zhang, Situo, et al.
Publicado: (2024)
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
por: Liu, Chengbo, et al.
Publicado: (2024)
por: Liu, Chengbo, et al.
Publicado: (2024)
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
por: Hu, Yuezhou, et al.
Publicado: (2025)
por: Hu, Yuezhou, et al.
Publicado: (2025)
Tutorial Proposal: Speculative Decoding for Efficient LLM Inference
por: Xia, Heming, et al.
Publicado: (2025)
por: Xia, Heming, et al.
Publicado: (2025)
AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism
por: Wei, Zhepei, et al.
Publicado: (2025)
por: Wei, Zhepei, et al.
Publicado: (2025)
Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding
por: Xia, Heming, et al.
Publicado: (2024)
por: Xia, Heming, et al.
Publicado: (2024)
SAP: Syntactic Attention Pruning for Transformer-based Language Models
por: Lee, Tzu-Yun, et al.
Publicado: (2025)
por: Lee, Tzu-Yun, et al.
Publicado: (2025)
Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference
por: Zhou, Xuwen, et al.
Publicado: (2026)
por: Zhou, Xuwen, et al.
Publicado: (2026)
Dynamic Speculation Lookahead Accelerates Speculative Decoding of Large Language Models
por: Mamou, Jonathan, et al.
Publicado: (2024)
por: Mamou, Jonathan, et al.
Publicado: (2024)
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
por: Liu, Tianyu, et al.
Publicado: (2024)
por: Liu, Tianyu, et al.
Publicado: (2024)
Speculative Decoding for Multi-Sample Inference
por: Li, Yiwei, et al.
Publicado: (2025)
por: Li, Yiwei, et al.
Publicado: (2025)
Efficient Adaptive Rejection Sampling for Accelerating Speculative Decoding in Large Language Models
por: Sun, Chendong, et al.
Publicado: (2025)
por: Sun, Chendong, et al.
Publicado: (2025)
Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning
por: Zhang, Jiebin, et al.
Publicado: (2026)
por: Zhang, Jiebin, et al.
Publicado: (2026)
Speculative Contrastive Decoding
por: Yuan, Hongyi, et al.
Publicado: (2023)
por: Yuan, Hongyi, et al.
Publicado: (2023)
Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions
por: Tang, Bangsheng, et al.
Publicado: (2025)
por: Tang, Bangsheng, et al.
Publicado: (2025)
AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback
por: Zhang, Wanpeng, et al.
Publicado: (2023)
por: Zhang, Wanpeng, et al.
Publicado: (2023)
DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference
por: Liu, Fuliang, et al.
Publicado: (2026)
por: Liu, Fuliang, et al.
Publicado: (2026)
AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs
por: Cui, Chengming, et al.
Publicado: (2026)
por: Cui, Chengming, et al.
Publicado: (2026)
Draft on the Fly: Adaptive Self-Speculative Decoding using Cosine Similarity
por: Metel, Michael R., et al.
Publicado: (2024)
por: Metel, Michael R., et al.
Publicado: (2024)
TALON: Confidence-Aware Speculative Decoding with Adaptive Token Trees
por: Liu, Tianyu, et al.
Publicado: (2026)
por: Liu, Tianyu, et al.
Publicado: (2026)
Self Speculative Decoding for Diffusion Large Language Models
por: Gao, Yifeng, et al.
Publicado: (2025)
por: Gao, Yifeng, et al.
Publicado: (2025)
Graph-Structured Speculative Decoding
por: Gong, Zhuocheng, et al.
Publicado: (2024)
por: Gong, Zhuocheng, et al.
Publicado: (2024)
3-Model Speculative Decoding
por: Byun, Sanghyun, et al.
Publicado: (2025)
por: Byun, Sanghyun, et al.
Publicado: (2025)
Beyond Tokens: Semantic-Aware Speculative Decoding for Efficient Inference by Probing Internal States
por: Dong, Ximing, et al.
Publicado: (2026)
por: Dong, Ximing, et al.
Publicado: (2026)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
por: Goel, Raghavv, et al.
Publicado: (2025)
por: Goel, Raghavv, et al.
Publicado: (2025)
Speculative Decoding Across Languages
por: Paudel, Nirajan, et al.
Publicado: (2026)
por: Paudel, Nirajan, et al.
Publicado: (2026)
FastAdaSP: Multitask-Adapted Efficient Inference for Large Speech Language Model
por: Lu, Yichen, et al.
Publicado: (2024)
por: Lu, Yichen, et al.
Publicado: (2024)
SPEED: Speculative Pipelined Execution for Efficient Decoding
por: Hooper, Coleman, et al.
Publicado: (2023)
por: Hooper, Coleman, et al.
Publicado: (2023)
Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding
por: Ryu, Hyun, et al.
Publicado: (2024)
por: Ryu, Hyun, et al.
Publicado: (2024)
AdaEDL: Early Draft Stopping for Speculative Decoding of Large Language Models via an Entropy-based Lower Bound on Token Acceptance Probability
por: Agrawal, Sudhanshu, et al.
Publicado: (2024)
por: Agrawal, Sudhanshu, et al.
Publicado: (2024)
Mirror Speculative Decoding: Breaking the Serial Barrier in LLM Inference
por: Bhendawade, Nikhil, et al.
Publicado: (2025)
por: Bhendawade, Nikhil, et al.
Publicado: (2025)
RAPID: Long-Context Inference with Retrieval-Augmented Speculative Decoding
por: Chen, Guanzheng, et al.
Publicado: (2025)
por: Chen, Guanzheng, et al.
Publicado: (2025)
S$^4$C: Speculative Sampling with Syntactic and Semantic Coherence for Efficient Inference of Large Language Models
por: He, Tao, et al.
Publicado: (2025)
por: He, Tao, et al.
Publicado: (2025)
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
por: Xia, Heming, et al.
Publicado: (2024)
por: Xia, Heming, et al.
Publicado: (2024)
Speculative Decoding with a Speculative Vocabulary
por: Williams, Miles, et al.
Publicado: (2026)
por: Williams, Miles, et al.
Publicado: (2026)
S2D: Sorted Speculative Decoding For More Efficient Deployment of Nested Large Language Models
por: Kavehzadeh, Parsa, et al.
Publicado: (2024)
por: Kavehzadeh, Parsa, et al.
Publicado: (2024)
Ejemplares similares
-
Hybrid Dual-Batch and Cyclic Progressive Learning for Efficient Distributed Training
por: Lu, Kuan-Wei, et al.
Publicado: (2025) -
EMS-SD: Efficient Multi-sample Speculative Decoding for Accelerating Large Language Models
por: Ni, Yunsheng, et al.
Publicado: (2024) -
AdaSpec: Adaptive Speculative Decoding for Fast, SLO-Aware Large Language Model Serving
por: Huang, Kaiyu, et al.
Publicado: (2025) -
DReSD: Dense Retrieval for Speculative Decoding
por: Gritta, Milan, et al.
Publicado: (2025) -
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
por: Zhang, Situo, et al.
Publicado: (2024)