Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Fangcheng, Tang, Yehui, Liu, Zhenhua, Ni, Yunsheng, Han, Kai, Wang, Yunhe |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EMS-SD: Efficient Multi-sample Speculative Decoding for Accelerating Large Language Models
di: Ni, Yunsheng, et al.
Pubblicazione: (2024)
di: Ni, Yunsheng, et al.
Pubblicazione: (2024)
PanGu-$π$ Pro:Rethinking Optimization and Architecture for Tiny Language Models
di: Tang, Yehui, et al.
Pubblicazione: (2024)
di: Tang, Yehui, et al.
Pubblicazione: (2024)
Boosting Lossless Speculative Decoding via Feature Sampling and Partial Alignment Distillation
di: Gui, Lujun, et al.
Pubblicazione: (2024)
di: Gui, Lujun, et al.
Pubblicazione: (2024)
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2025)
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2025)
TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
di: Sun, Hanshi, et al.
Pubblicazione: (2024)
di: Sun, Hanshi, et al.
Pubblicazione: (2024)
DenseMamba: State Space Models with Dense Hidden Connection for Efficient Large Language Models
di: He, Wei, et al.
Pubblicazione: (2024)
di: He, Wei, et al.
Pubblicazione: (2024)
Mixture of Lookup Experts
di: Jie, Shibo, et al.
Pubblicazione: (2025)
di: Jie, Shibo, et al.
Pubblicazione: (2025)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
di: Yang, Penghui, et al.
Pubblicazione: (2025)
di: Yang, Penghui, et al.
Pubblicazione: (2025)
Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous Vocabularies
di: Timor, Nadav, et al.
Pubblicazione: (2025)
di: Timor, Nadav, et al.
Pubblicazione: (2025)
PocketLLM: Ultimate Compression of Large Language Models via Meta Networks
di: Tian, Ye, et al.
Pubblicazione: (2025)
di: Tian, Ye, et al.
Pubblicazione: (2025)
Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
di: Jie, Shibo, et al.
Pubblicazione: (2024)
di: Jie, Shibo, et al.
Pubblicazione: (2024)
LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
di: Elhoushi, Mostafa, et al.
Pubblicazione: (2024)
di: Elhoushi, Mostafa, et al.
Pubblicazione: (2024)
Decoding Speculative Decoding
di: Yan, Minghao, et al.
Pubblicazione: (2024)
di: Yan, Minghao, et al.
Pubblicazione: (2024)
PanGu-$π$: Enhancing Language Model Architectures via Nonlinearity Compensation
di: Wang, Yunhe, et al.
Pubblicazione: (2023)
di: Wang, Yunhe, et al.
Pubblicazione: (2023)
A Survey on Transformer Compression
di: Tang, Yehui, et al.
Pubblicazione: (2024)
di: Tang, Yehui, et al.
Pubblicazione: (2024)
RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding
di: Hoshino, Yuichiro, et al.
Pubblicazione: (2025)
di: Hoshino, Yuichiro, et al.
Pubblicazione: (2025)
Online Speculative Decoding
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
Self-Speculative Biased Decoding for Faster Re-Translation
di: Zeng, Linxiao, et al.
Pubblicazione: (2025)
di: Zeng, Linxiao, et al.
Pubblicazione: (2025)
DE$^3$-BERT: Distance-Enhanced Early Exiting for BERT based on Prototypical Networks
di: He, Jianing, et al.
Pubblicazione: (2024)
di: He, Jianing, et al.
Pubblicazione: (2024)
Speculative Decoding Across Languages
di: Paudel, Nirajan, et al.
Pubblicazione: (2026)
di: Paudel, Nirajan, et al.
Pubblicazione: (2026)
MeKi: Memory-based Expert Knowledge Injection for Efficient LLM Scaling
di: Ding, Ning, et al.
Pubblicazione: (2026)
di: Ding, Ning, et al.
Pubblicazione: (2026)
Faster Cascades via Speculative Decoding
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
DEL: Context-Aware Dynamic Exit Layer for Efficient Self-Speculative Decoding
di: Zarch, Hossein Entezari, et al.
Pubblicazione: (2025)
di: Zarch, Hossein Entezari, et al.
Pubblicazione: (2025)
ConfLayers: Adaptive Confidence-based Layer Skipping for Self-Speculative Decoding
di: Amer, Walaa, et al.
Pubblicazione: (2026)
di: Amer, Walaa, et al.
Pubblicazione: (2026)
Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference
di: Zhou, Xuwen, et al.
Pubblicazione: (2026)
di: Zhou, Xuwen, et al.
Pubblicazione: (2026)
Lossless Acceleration of Large Language Model via Adaptive N-gram Parallel Decoding
di: Ou, Jie, et al.
Pubblicazione: (2024)
di: Ou, Jie, et al.
Pubblicazione: (2024)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
Scaling Speculative Decoding with Lookahead Reasoning
di: Fu, Yichao, et al.
Pubblicazione: (2025)
di: Fu, Yichao, et al.
Pubblicazione: (2025)
Traversal Verification for Speculative Tree Decoding
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding
di: Li, Jinze, et al.
Pubblicazione: (2025)
di: Li, Jinze, et al.
Pubblicazione: (2025)
Multimodal Adaptive Inference for Document Image Classification with Anytime Early Exiting
di: Hamed, Omar, et al.
Pubblicazione: (2024)
di: Hamed, Omar, et al.
Pubblicazione: (2024)
Mixture of Attentions For Speculative Decoding
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
Recurrent Drafter for Fast Speculative Decoding in Large Language Models
di: Cheng, Yunfei, et al.
Pubblicazione: (2024)
di: Cheng, Yunfei, et al.
Pubblicazione: (2024)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
di: Long, Xiang, et al.
Pubblicazione: (2026)
di: Long, Xiang, et al.
Pubblicazione: (2026)
Out-of-Vocabulary Sampling Boosts Speculative Decoding
di: Timor, Nadav, et al.
Pubblicazione: (2025)
di: Timor, Nadav, et al.
Pubblicazione: (2025)
Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding
di: Iso, Hayate, et al.
Pubblicazione: (2026)
di: Iso, Hayate, et al.
Pubblicazione: (2026)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
Distributed Speculative Inference (DSI): Speculation Parallelism for Provably Faster Lossless Language Model Inference
di: Timor, Nadav, et al.
Pubblicazione: (2024)
di: Timor, Nadav, et al.
Pubblicazione: (2024)
Speculative Decoding for Verilog: Speed and Quality, All in One
di: Xu, Changran, et al.
Pubblicazione: (2025)
di: Xu, Changran, et al.
Pubblicazione: (2025)
Documenti analoghi
-
EMS-SD: Efficient Multi-sample Speculative Decoding for Accelerating Large Language Models
di: Ni, Yunsheng, et al.
Pubblicazione: (2024) -
PanGu-$π$ Pro:Rethinking Optimization and Architecture for Tiny Language Models
di: Tang, Yehui, et al.
Pubblicazione: (2024) -
Boosting Lossless Speculative Decoding via Feature Sampling and Partial Alignment Distillation
di: Gui, Lujun, et al.
Pubblicazione: (2024) -
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2025) -
TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
di: Sun, Hanshi, et al.
Pubblicazione: (2024)