RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding
Fuente:
arXiv
Salvato in:
| Autori principali: | Hoshino, Yuichiro, Tachibana, Hideyuki, Inahara, Muneyoshi, Takegawa, Hiroto |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
di: Zhou, Yongchao, et al.
Pubblicazione: (2023)
di: Zhou, Yongchao, et al.
Pubblicazione: (2023)
Boosting Lossless Speculative Decoding via Feature Sampling and Partial Alignment Distillation
di: Gui, Lujun, et al.
Pubblicazione: (2024)
di: Gui, Lujun, et al.
Pubblicazione: (2024)
DEL: Context-Aware Dynamic Exit Layer for Efficient Self-Speculative Decoding
di: Zarch, Hossein Entezari, et al.
Pubblicazione: (2025)
di: Zarch, Hossein Entezari, et al.
Pubblicazione: (2025)
MASSV: Multimodal Adaptation and Self-Data Distillation for Speculative Decoding of Vision-Language Models
di: Ganesan, Mugilan, et al.
Pubblicazione: (2025)
di: Ganesan, Mugilan, et al.
Pubblicazione: (2025)
Decoding Speculative Decoding
di: Yan, Minghao, et al.
Pubblicazione: (2024)
di: Yan, Minghao, et al.
Pubblicazione: (2024)
Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting
di: Liu, Fangcheng, et al.
Pubblicazione: (2024)
di: Liu, Fangcheng, et al.
Pubblicazione: (2024)
Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
di: Ziashahabi, Amir, et al.
Pubblicazione: (2025)
di: Ziashahabi, Amir, et al.
Pubblicazione: (2025)
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
di: Hu, Yuezhou, et al.
Pubblicazione: (2025)
di: Hu, Yuezhou, et al.
Pubblicazione: (2025)
Speculative Decoding Across Languages
di: Paudel, Nirajan, et al.
Pubblicazione: (2026)
di: Paudel, Nirajan, et al.
Pubblicazione: (2026)
Faster Cascades via Speculative Decoding
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
Self-Speculative Biased Decoding for Faster Re-Translation
di: Zeng, Linxiao, et al.
Pubblicazione: (2025)
di: Zeng, Linxiao, et al.
Pubblicazione: (2025)
ConfLayers: Adaptive Confidence-based Layer Skipping for Self-Speculative Decoding
di: Amer, Walaa, et al.
Pubblicazione: (2026)
di: Amer, Walaa, et al.
Pubblicazione: (2026)
Scaling Speculative Decoding with Lookahead Reasoning
di: Fu, Yichao, et al.
Pubblicazione: (2025)
di: Fu, Yichao, et al.
Pubblicazione: (2025)
Fast Large Language Model Collaborative Decoding via Speculation
di: Fu, Jiale, et al.
Pubblicazione: (2025)
di: Fu, Jiale, et al.
Pubblicazione: (2025)
Recurrent Drafter for Fast Speculative Decoding in Large Language Models
di: Cheng, Yunfei, et al.
Pubblicazione: (2024)
di: Cheng, Yunfei, et al.
Pubblicazione: (2024)
Online Speculative Decoding
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification
di: Zhou, Yuhang, et al.
Pubblicazione: (2026)
di: Zhou, Yuhang, et al.
Pubblicazione: (2026)
Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding
di: Li, Jinze, et al.
Pubblicazione: (2025)
di: Li, Jinze, et al.
Pubblicazione: (2025)
Out-of-Vocabulary Sampling Boosts Speculative Decoding
di: Timor, Nadav, et al.
Pubblicazione: (2025)
di: Timor, Nadav, et al.
Pubblicazione: (2025)
DualDiffusion: A Speculative Decoding Strategy for Masked Diffusion Models
di: Goyal, Satyam, et al.
Pubblicazione: (2026)
di: Goyal, Satyam, et al.
Pubblicazione: (2026)
On Speculative Decoding for Multimodal Large Language Models
di: Gagrani, Mukul, et al.
Pubblicazione: (2024)
di: Gagrani, Mukul, et al.
Pubblicazione: (2024)
Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding
di: Iso, Hayate, et al.
Pubblicazione: (2026)
di: Iso, Hayate, et al.
Pubblicazione: (2026)
LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
di: Elhoushi, Mostafa, et al.
Pubblicazione: (2024)
di: Elhoushi, Mostafa, et al.
Pubblicazione: (2024)
Mixture of Attentions For Speculative Decoding
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding
di: Sun, Shuoyang, et al.
Pubblicazione: (2026)
di: Sun, Shuoyang, et al.
Pubblicazione: (2026)
Judge Decoding: Faster Speculative Sampling Requires Going Beyond Model Alignment
di: Bachmann, Gregor, et al.
Pubblicazione: (2025)
di: Bachmann, Gregor, et al.
Pubblicazione: (2025)
Reviving Any-Subset Autoregressive Models with Principled Parallel Sampling and Speculative Decoding
di: Guo, Gabe, et al.
Pubblicazione: (2025)
di: Guo, Gabe, et al.
Pubblicazione: (2025)
Confidence-Modulated Speculative Decoding for Large Language Models
di: Sen, Jaydip, et al.
Pubblicazione: (2025)
di: Sen, Jaydip, et al.
Pubblicazione: (2025)
Speculative Diffusion Decoding: Accelerating Language Generation through Diffusion
di: Christopher, Jacob K, et al.
Pubblicazione: (2024)
di: Christopher, Jacob K, et al.
Pubblicazione: (2024)
LK Losses: Direct Acceptance Rate Optimization for Speculative Decoding
di: Samarin, Alexander, et al.
Pubblicazione: (2026)
di: Samarin, Alexander, et al.
Pubblicazione: (2026)
Traversal Verification for Speculative Tree Decoding
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2025)
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2025)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
TapOut: A Bandit-Based Approach to Dynamic Speculative Decoding
di: Sridhar, Aditya, et al.
Pubblicazione: (2025)
di: Sridhar, Aditya, et al.
Pubblicazione: (2025)
Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference
di: Zhou, Xuwen, et al.
Pubblicazione: (2026)
di: Zhou, Xuwen, et al.
Pubblicazione: (2026)
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
di: Zhao, Siyan, et al.
Pubblicazione: (2026)
di: Zhao, Siyan, et al.
Pubblicazione: (2026)
HiSpec: Hierarchical Speculative Decoding for LLMs
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
Benchmarking the Energy Savings with Speculative Decoding Strategies
di: Dutta, Rohit, et al.
Pubblicazione: (2026)
di: Dutta, Rohit, et al.
Pubblicazione: (2026)
Documenti analoghi
-
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
di: Zhou, Yongchao, et al.
Pubblicazione: (2023) -
Boosting Lossless Speculative Decoding via Feature Sampling and Partial Alignment Distillation
di: Gui, Lujun, et al.
Pubblicazione: (2024) -
DEL: Context-Aware Dynamic Exit Layer for Efficient Self-Speculative Decoding
di: Zarch, Hossein Entezari, et al.
Pubblicazione: (2025) -
MASSV: Multimodal Adaptation and Self-Data Distillation for Speculative Decoding of Vision-Language Models
di: Ganesan, Mugilan, et al.
Pubblicazione: (2025) -
Decoding Speculative Decoding
di: Yan, Minghao, et al.
Pubblicazione: (2024)