Speculative Speculative Decoding
Fuente:
arXiv
Guardado en:
| Autores principales: | Kumar, Tanishq, Dao, Tri, May, Avner |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Decoding Speculative Decoding
por: Yan, Minghao, et al.
Publicado: (2024)
por: Yan, Minghao, et al.
Publicado: (2024)
Beat the long tail: Distribution-Aware Speculative Decoding for RL Training
por: Shao, Zelei, et al.
Publicado: (2025)
por: Shao, Zelei, et al.
Publicado: (2025)
When RL Meets Adaptive Speculative Training: A Unified Training-Serving System
por: Wang, Junxiong, et al.
Publicado: (2026)
por: Wang, Junxiong, et al.
Publicado: (2026)
Online Speculative Decoding
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
Speculative Decoding Across Languages
por: Paudel, Nirajan, et al.
Publicado: (2026)
por: Paudel, Nirajan, et al.
Publicado: (2026)
Speculative Safety-Aware Decoding
por: Wang, Xuekang, et al.
Publicado: (2025)
por: Wang, Xuekang, et al.
Publicado: (2025)
The Mamba in the Llama: Distilling and Accelerating Hybrid Models
por: Wang, Junxiong, et al.
Publicado: (2024)
por: Wang, Junxiong, et al.
Publicado: (2024)
Faster Cascades via Speculative Decoding
por: Narasimhan, Harikrishna, et al.
Publicado: (2024)
por: Narasimhan, Harikrishna, et al.
Publicado: (2024)
HiSpec: Hierarchical Speculative Decoding for LLMs
por: Kumar, Avinash, et al.
Publicado: (2025)
por: Kumar, Avinash, et al.
Publicado: (2025)
Mixture of Attentions For Speculative Decoding
por: Zimmer, Matthieu, et al.
Publicado: (2024)
por: Zimmer, Matthieu, et al.
Publicado: (2024)
Fast Inference via Hierarchical Speculative Decoding
por: Mohri, Clara, et al.
Publicado: (2025)
por: Mohri, Clara, et al.
Publicado: (2025)
Scaling Speculative Decoding with Lookahead Reasoning
por: Fu, Yichao, et al.
Publicado: (2025)
por: Fu, Yichao, et al.
Publicado: (2025)
Steering Pretrained Drafters during Speculative Decoding
por: Berdoz, Frédéric, et al.
Publicado: (2025)
por: Berdoz, Frédéric, et al.
Publicado: (2025)
Traversal Verification for Speculative Tree Decoding
por: Weng, Yepeng, et al.
Publicado: (2025)
por: Weng, Yepeng, et al.
Publicado: (2025)
Polybasic Speculative Decoding Through a Theoretical Perspective
por: Wang, Ruilin, et al.
Publicado: (2025)
por: Wang, Ruilin, et al.
Publicado: (2025)
FastEagle: Cascaded Drafting for Accelerating Speculative Decoding
por: Huang, Haiduo, et al.
Publicado: (2025)
por: Huang, Haiduo, et al.
Publicado: (2025)
SPIRe: Boosting LLM Inference Throughput with Speculative Decoding
por: Neelam, Sanjit, et al.
Publicado: (2025)
por: Neelam, Sanjit, et al.
Publicado: (2025)
Accelerating Time Series Foundation Models with Speculative Decoding
por: Subbaraman, Pranav, et al.
Publicado: (2025)
por: Subbaraman, Pranav, et al.
Publicado: (2025)
QSpec: Speculative Decoding with Complementary Quantization Schemes
por: Zhao, Juntao, et al.
Publicado: (2024)
por: Zhao, Juntao, et al.
Publicado: (2024)
Out-of-Vocabulary Sampling Boosts Speculative Decoding
por: Timor, Nadav, et al.
Publicado: (2025)
por: Timor, Nadav, et al.
Publicado: (2025)
Test-Time Speculation
por: Kumar, Avinash, et al.
Publicado: (2026)
por: Kumar, Avinash, et al.
Publicado: (2026)
An Interpretable Latency Model for Speculative Decoding in LLM Serving
por: Kong, Linghao, et al.
Publicado: (2026)
por: Kong, Linghao, et al.
Publicado: (2026)
REST: Retrieval-Based Speculative Decoding
por: He, Zhenyu, et al.
Publicado: (2023)
por: He, Zhenyu, et al.
Publicado: (2023)
FastVLM: Self-Speculative Decoding for Fast Vision-Language Model Inference
por: Bajpai, Divya Jyoti, et al.
Publicado: (2025)
por: Bajpai, Divya Jyoti, et al.
Publicado: (2025)
MoE-Spec: Expert Budgeting for Efficient Speculative Decoding
por: McDanel, Bradley, et al.
Publicado: (2026)
por: McDanel, Bradley, et al.
Publicado: (2026)
Draft, Verify, and Improve: Toward Training-Aware Speculative Decoding
por: Bhansali, Shrenik, et al.
Publicado: (2025)
por: Bhansali, Shrenik, et al.
Publicado: (2025)
Benchmarking the Energy Savings with Speculative Decoding Strategies
por: Dutta, Rohit, et al.
Publicado: (2026)
por: Dutta, Rohit, et al.
Publicado: (2026)
On Speculative Decoding for Multimodal Large Language Models
por: Gagrani, Mukul, et al.
Publicado: (2024)
por: Gagrani, Mukul, et al.
Publicado: (2024)
A Theoretical Perspective for Speculative Decoding Algorithm
por: Yin, Ming, et al.
Publicado: (2024)
por: Yin, Ming, et al.
Publicado: (2024)
Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding
por: Sun, Shuoyang, et al.
Publicado: (2026)
por: Sun, Shuoyang, et al.
Publicado: (2026)
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
por: Xiao, Zilin, et al.
Publicado: (2024)
por: Xiao, Zilin, et al.
Publicado: (2024)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
por: Goel, Raghavv, et al.
Publicado: (2025)
por: Goel, Raghavv, et al.
Publicado: (2025)
Block Verification Accelerates Speculative Decoding
por: Sun, Ziteng, et al.
Publicado: (2024)
por: Sun, Ziteng, et al.
Publicado: (2024)
SSSD: Simply-Scalable Speculative Decoding
por: Marzollo, Michele, et al.
Publicado: (2024)
por: Marzollo, Michele, et al.
Publicado: (2024)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
por: Zhou, Yongchao, et al.
Publicado: (2023)
por: Zhou, Yongchao, et al.
Publicado: (2023)
KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models
por: Zheng, Zihao, et al.
Publicado: (2026)
por: Zheng, Zihao, et al.
Publicado: (2026)
When Speculation Spills Secrets: Side Channels via Speculative Decoding In LLMs
por: Wei, Jiankun, et al.
Publicado: (2024)
por: Wei, Jiankun, et al.
Publicado: (2024)
Principled Coarse-Grained Acceptance for Speculative Decoding in Speech
por: Yanuka, Moran, et al.
Publicado: (2025)
por: Yanuka, Moran, et al.
Publicado: (2025)
MARS: Unleashing the Power of Speculative Decoding via Margin-Aware Verification
por: Song, Jingwei, et al.
Publicado: (2026)
por: Song, Jingwei, et al.
Publicado: (2026)
Dynamic Delayed Tree Expansion For Improved Multi-Path Speculative Decoding
por: Thomas, Rahul, et al.
Publicado: (2026)
por: Thomas, Rahul, et al.
Publicado: (2026)
Ejemplares similares
-
Decoding Speculative Decoding
por: Yan, Minghao, et al.
Publicado: (2024) -
Beat the long tail: Distribution-Aware Speculative Decoding for RL Training
por: Shao, Zelei, et al.
Publicado: (2025) -
When RL Meets Adaptive Speculative Training: A Unified Training-Serving System
por: Wang, Junxiong, et al.
Publicado: (2026) -
Online Speculative Decoding
por: Liu, Xiaoxuan, et al.
Publicado: (2023) -
Speculative Decoding Across Languages
por: Paudel, Nirajan, et al.
Publicado: (2026)