LK Losses: Direct Acceptance Rate Optimization for Speculative Decoding
Fuente:
arXiv
Salvato in:
| Autori principali: | Samarin, Alexander, Krutikov, Sergei, Shevtsov, Anton, Skvortsov, Sergei, Fisin, Filipp, Golubev, Alexander |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding
di: Plaksin, Anton, et al.
Pubblicazione: (2026)
di: Plaksin, Anton, et al.
Pubblicazione: (2026)
Training Long-Context, Multi-Turn Software Engineering Agents with Reinforcement Learning
di: Golubev, Alexander, et al.
Pubblicazione: (2025)
di: Golubev, Alexander, et al.
Pubblicazione: (2025)
Guided Search Strategies in Non-Serializable Environments with Applications to Software Engineering Agents
di: Zainullina, Karina, et al.
Pubblicazione: (2025)
di: Zainullina, Karina, et al.
Pubblicazione: (2025)
Decoding Speculative Decoding
di: Yan, Minghao, et al.
Pubblicazione: (2024)
di: Yan, Minghao, et al.
Pubblicazione: (2024)
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
Speculative Decoding Across Languages
di: Paudel, Nirajan, et al.
Pubblicazione: (2026)
di: Paudel, Nirajan, et al.
Pubblicazione: (2026)
AdaEDL: Early Draft Stopping for Speculative Decoding of Large Language Models via an Entropy-based Lower Bound on Token Acceptance Probability
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2024)
di: Agrawal, Sudhanshu, et al.
Pubblicazione: (2024)
Scaling Speculative Decoding with Lookahead Reasoning
di: Fu, Yichao, et al.
Pubblicazione: (2025)
di: Fu, Yichao, et al.
Pubblicazione: (2025)
Online Speculative Decoding
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
Out-of-Vocabulary Sampling Boosts Speculative Decoding
di: Timor, Nadav, et al.
Pubblicazione: (2025)
di: Timor, Nadav, et al.
Pubblicazione: (2025)
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
di: Goel, Raghavv, et al.
Pubblicazione: (2024)
di: Goel, Raghavv, et al.
Pubblicazione: (2024)
Mixture of Attentions For Speculative Decoding
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding
di: Sun, Shuoyang, et al.
Pubblicazione: (2026)
di: Sun, Shuoyang, et al.
Pubblicazione: (2026)
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
Speculative Decoding Scaling Laws (SDSL): Throughput Optimization Made Simple
di: Bozorgkhoo, Amirhossein, et al.
Pubblicazione: (2026)
di: Bozorgkhoo, Amirhossein, et al.
Pubblicazione: (2026)
Speculative Diffusion Decoding: Accelerating Language Generation through Diffusion
di: Christopher, Jacob K, et al.
Pubblicazione: (2024)
di: Christopher, Jacob K, et al.
Pubblicazione: (2024)
Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
di: Ziashahabi, Amir, et al.
Pubblicazione: (2025)
di: Ziashahabi, Amir, et al.
Pubblicazione: (2025)
Recurrent Drafter for Fast Speculative Decoding in Large Language Models
di: Cheng, Yunfei, et al.
Pubblicazione: (2024)
di: Cheng, Yunfei, et al.
Pubblicazione: (2024)
Traversal Verification for Speculative Tree Decoding
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
Faster Cascades via Speculative Decoding
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference
di: Zhou, Xuwen, et al.
Pubblicazione: (2026)
di: Zhou, Xuwen, et al.
Pubblicazione: (2026)
DualDiffusion: A Speculative Decoding Strategy for Masked Diffusion Models
di: Goyal, Satyam, et al.
Pubblicazione: (2026)
di: Goyal, Satyam, et al.
Pubblicazione: (2026)
TapOut: A Bandit-Based Approach to Dynamic Speculative Decoding
di: Sridhar, Aditya, et al.
Pubblicazione: (2025)
di: Sridhar, Aditya, et al.
Pubblicazione: (2025)
Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting
di: Liu, Fangcheng, et al.
Pubblicazione: (2024)
di: Liu, Fangcheng, et al.
Pubblicazione: (2024)
Benchmarking the Energy Savings with Speculative Decoding Strategies
di: Dutta, Rohit, et al.
Pubblicazione: (2026)
di: Dutta, Rohit, et al.
Pubblicazione: (2026)
On Speculative Decoding for Multimodal Large Language Models
di: Gagrani, Mukul, et al.
Pubblicazione: (2024)
di: Gagrani, Mukul, et al.
Pubblicazione: (2024)
HiSpec: Hierarchical Speculative Decoding for LLMs
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
A Theoretical Perspective for Speculative Decoding Algorithm
di: Yin, Ming, et al.
Pubblicazione: (2024)
di: Yin, Ming, et al.
Pubblicazione: (2024)
Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding
di: Iso, Hayate, et al.
Pubblicazione: (2026)
di: Iso, Hayate, et al.
Pubblicazione: (2026)
TABED: Test-Time Adaptive Ensemble Drafting for Robust Speculative Decoding in LVLMs
di: Lee, Minjae, et al.
Pubblicazione: (2026)
di: Lee, Minjae, et al.
Pubblicazione: (2026)
ConfLayers: Adaptive Confidence-based Layer Skipping for Self-Speculative Decoding
di: Amer, Walaa, et al.
Pubblicazione: (2026)
di: Amer, Walaa, et al.
Pubblicazione: (2026)
Boosting Lossless Speculative Decoding via Feature Sampling and Partial Alignment Distillation
di: Gui, Lujun, et al.
Pubblicazione: (2024)
di: Gui, Lujun, et al.
Pubblicazione: (2024)
Judge Decoding: Faster Speculative Sampling Requires Going Beyond Model Alignment
di: Bachmann, Gregor, et al.
Pubblicazione: (2025)
di: Bachmann, Gregor, et al.
Pubblicazione: (2025)
DEL: Context-Aware Dynamic Exit Layer for Efficient Self-Speculative Decoding
di: Zarch, Hossein Entezari, et al.
Pubblicazione: (2025)
di: Zarch, Hossein Entezari, et al.
Pubblicazione: (2025)
RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding
di: Hoshino, Yuichiro, et al.
Pubblicazione: (2025)
di: Hoshino, Yuichiro, et al.
Pubblicazione: (2025)
Reviving Any-Subset Autoregressive Models with Principled Parallel Sampling and Speculative Decoding
di: Guo, Gabe, et al.
Pubblicazione: (2025)
di: Guo, Gabe, et al.
Pubblicazione: (2025)
TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
di: Sun, Hanshi, et al.
Pubblicazione: (2024)
di: Sun, Hanshi, et al.
Pubblicazione: (2024)
Optimized Speculative Sampling for GPU Hardware Accelerators
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
Self-Speculative Biased Decoding for Faster Re-Translation
di: Zeng, Linxiao, et al.
Pubblicazione: (2025)
di: Zeng, Linxiao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding
di: Plaksin, Anton, et al.
Pubblicazione: (2026) -
Training Long-Context, Multi-Turn Software Engineering Agents with Reinforcement Learning
di: Golubev, Alexander, et al.
Pubblicazione: (2025) -
Guided Search Strategies in Non-Serializable Environments with Applications to Software Engineering Agents
di: Zainullina, Karina, et al.
Pubblicazione: (2025) -
Decoding Speculative Decoding
di: Yan, Minghao, et al.
Pubblicazione: (2024) -
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)