Towards Fast Multilingual LLM Inference: Speculative Decoding and Specialized Drafters
Fuente:
arXiv
Guardado en:
| Autores principales: | Yi, Euiin, Kim, Taehyeon, Jeung, Hongseok, Chang, Du-Seong, Yun, Se-Young |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multi-Drafter Speculative Decoding with Alignment Feedback
por: Kim, Taehyeon, et al.
Publicado: (2026)
por: Kim, Taehyeon, et al.
Publicado: (2026)
Guiding Reasoning in Small Language Models with LLM Assistance
por: Kim, Yujin, et al.
Publicado: (2025)
por: Kim, Yujin, et al.
Publicado: (2025)
Mamba Drafters for Speculative Decoding
por: Choi, Daewon, et al.
Publicado: (2025)
por: Choi, Daewon, et al.
Publicado: (2025)
Recurrent Drafter for Fast Speculative Decoding in Large Language Models
por: Cheng, Yunfei, et al.
Publicado: (2024)
por: Cheng, Yunfei, et al.
Publicado: (2024)
Instructive Decoding: Instruction-Tuned Large Language Models are Self-Refiner from Noisy Instructions
por: Kim, Taehyeon, et al.
Publicado: (2023)
por: Kim, Taehyeon, et al.
Publicado: (2023)
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
por: Xiao, Zilin, et al.
Publicado: (2024)
por: Xiao, Zilin, et al.
Publicado: (2024)
Coupling without Communication and Drafter-Invariant Speculative Decoding
por: Daliri, Majid, et al.
Publicado: (2024)
por: Daliri, Majid, et al.
Publicado: (2024)
SpecDiff-2: Scaling Diffusion Drafter Alignment For Faster Speculative Decoding
por: Sandler, Jameson, et al.
Publicado: (2025)
por: Sandler, Jameson, et al.
Publicado: (2025)
READER: Retrieval-Assisted Drafter for Efficient LLM Inference
por: Divilkovskiy, Maxim, et al.
Publicado: (2025)
por: Divilkovskiy, Maxim, et al.
Publicado: (2025)
DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference
por: Liu, Fuliang, et al.
Publicado: (2026)
por: Liu, Fuliang, et al.
Publicado: (2026)
Block Transformer: Global-to-Local Language Modeling for Fast Inference
por: Ho, Namgyu, et al.
Publicado: (2024)
por: Ho, Namgyu, et al.
Publicado: (2024)
Tutorial Proposal: Speculative Decoding for Efficient LLM Inference
por: Xia, Heming, et al.
Publicado: (2025)
por: Xia, Heming, et al.
Publicado: (2025)
OmniDraft: A Cross-vocabulary, Online Adaptive Drafter for On-device Speculative Decoding
por: Ramakrishnan, Ramchalam Kinattinkara, et al.
Publicado: (2025)
por: Ramakrishnan, Ramchalam Kinattinkara, et al.
Publicado: (2025)
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
por: Xia, Heming, et al.
Publicado: (2024)
por: Xia, Heming, et al.
Publicado: (2024)
Mirror Speculative Decoding: Breaking the Serial Barrier in LLM Inference
por: Bhendawade, Nikhil, et al.
Publicado: (2025)
por: Bhendawade, Nikhil, et al.
Publicado: (2025)
Speculative Decoding with a Speculative Vocabulary
por: Williams, Miles, et al.
Publicado: (2026)
por: Williams, Miles, et al.
Publicado: (2026)
3-Model Speculative Decoding
por: Byun, Sanghyun, et al.
Publicado: (2025)
por: Byun, Sanghyun, et al.
Publicado: (2025)
DistiLLM: Towards Streamlined Distillation for Large Language Models
por: Ko, Jongwoo, et al.
Publicado: (2024)
por: Ko, Jongwoo, et al.
Publicado: (2024)
Revisiting Early-Learning Regularization When Federated Learning Meets Noisy Labels
por: Kim, Taehyeon, et al.
Publicado: (2024)
por: Kim, Taehyeon, et al.
Publicado: (2024)
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
por: Liu, Chengbo, et al.
Publicado: (2024)
por: Liu, Chengbo, et al.
Publicado: (2024)
Speculative Contrastive Decoding
por: Yuan, Hongyi, et al.
Publicado: (2023)
por: Yuan, Hongyi, et al.
Publicado: (2023)
Speculative Decoding for Multi-Sample Inference
por: Li, Yiwei, et al.
Publicado: (2025)
por: Li, Yiwei, et al.
Publicado: (2025)
Entropy-Aware Speculative Decoding Toward Improved LLM Reasoning
por: Su, Tiancheng, et al.
Publicado: (2025)
por: Su, Tiancheng, et al.
Publicado: (2025)
Training-free Dropout Sampling for Semantic Token Acceptance in Speculative Decoding
por: Lee, Jeongtae, et al.
Publicado: (2026)
por: Lee, Jeongtae, et al.
Publicado: (2026)
CORAL: Learning Consistent Representations across Multi-step Training with Lighter Speculative Drafter
por: Weng, Yepeng, et al.
Publicado: (2025)
por: Weng, Yepeng, et al.
Publicado: (2025)
SpecExec: Massively Parallel Speculative Decoding for Interactive LLM Inference on Consumer Devices
por: Svirschevski, Ruslan, et al.
Publicado: (2024)
por: Svirschevski, Ruslan, et al.
Publicado: (2024)
Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding
por: Kim, Sungkyun, et al.
Publicado: (2025)
por: Kim, Sungkyun, et al.
Publicado: (2025)
Fast Best-of-N Decoding via Speculative Rejection
por: Sun, Hanshi, et al.
Publicado: (2024)
por: Sun, Hanshi, et al.
Publicado: (2024)
Speculative Streaming: Fast LLM Inference without Auxiliary Models
por: Bhendawade, Nikhil, et al.
Publicado: (2024)
por: Bhendawade, Nikhil, et al.
Publicado: (2024)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
por: Wen, Zhuofan, et al.
Publicado: (2024)
por: Wen, Zhuofan, et al.
Publicado: (2024)
Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous Vocabularies
por: Timor, Nadav, et al.
Publicado: (2025)
por: Timor, Nadav, et al.
Publicado: (2025)
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
por: Liu, Jiahao, et al.
Publicado: (2024)
por: Liu, Jiahao, et al.
Publicado: (2024)
Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding
por: Ryu, Hyun, et al.
Publicado: (2024)
por: Ryu, Hyun, et al.
Publicado: (2024)
RAPID: Long-Context Inference with Retrieval-Augmented Speculative Decoding
por: Chen, Guanzheng, et al.
Publicado: (2025)
por: Chen, Guanzheng, et al.
Publicado: (2025)
Nearest Neighbor Speculative Decoding for LLM Generation and Attribution
por: Li, Minghan, et al.
Publicado: (2024)
por: Li, Minghan, et al.
Publicado: (2024)
Cascade Speculative Drafting for Even Faster LLM Inference
por: Chen, Ziyi, et al.
Publicado: (2023)
por: Chen, Ziyi, et al.
Publicado: (2023)
Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency
por: Li, Ruixiao, et al.
Publicado: (2025)
por: Li, Ruixiao, et al.
Publicado: (2025)
SelfJudge: Faster Speculative Decoding via Self-Supervised Judge Verification
por: Yoon, Kanghoon, et al.
Publicado: (2025)
por: Yoon, Kanghoon, et al.
Publicado: (2025)
Decoding Speculative Decoding
por: Yan, Minghao, et al.
Publicado: (2024)
por: Yan, Minghao, et al.
Publicado: (2024)
AdaSD: Adaptive Speculative Decoding for Efficient Language Model Inference
por: Lu, Kuan-Wei, et al.
Publicado: (2025)
por: Lu, Kuan-Wei, et al.
Publicado: (2025)
Ejemplares similares
-
Multi-Drafter Speculative Decoding with Alignment Feedback
por: Kim, Taehyeon, et al.
Publicado: (2026) -
Guiding Reasoning in Small Language Models with LLM Assistance
por: Kim, Yujin, et al.
Publicado: (2025) -
Mamba Drafters for Speculative Decoding
por: Choi, Daewon, et al.
Publicado: (2025) -
Recurrent Drafter for Fast Speculative Decoding in Large Language Models
por: Cheng, Yunfei, et al.
Publicado: (2024) -
Instructive Decoding: Instruction-Tuned Large Language Models are Self-Refiner from Noisy Instructions
por: Kim, Taehyeon, et al.
Publicado: (2023)