Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Yudi, Zhao, Weilin, Han, Xu, Zhao, Tiejun, Xu, Wang, Cao, Hailong, Zhu, Conghui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling
por: Zhao, Weilin, et al.
Publicado: (2025)
por: Zhao, Weilin, et al.
Publicado: (2025)
HiSpec: Hierarchical Speculative Decoding for LLMs
por: Kumar, Avinash, et al.
Publicado: (2025)
por: Kumar, Avinash, et al.
Publicado: (2025)
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
por: Georganas, Evangelos, et al.
Publicado: (2025)
por: Georganas, Evangelos, et al.
Publicado: (2025)
Online Speculative Decoding
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
QSpec: Speculative Decoding with Complementary Quantization Schemes
por: Zhao, Juntao, et al.
Publicado: (2024)
por: Zhao, Juntao, et al.
Publicado: (2024)
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
por: Hu, Yuezhou, et al.
Publicado: (2025)
por: Hu, Yuezhou, et al.
Publicado: (2025)
When Drafts Evolve: Speculative Decoding Meets Online Learning
por: Qian, Yu-Yang, et al.
Publicado: (2026)
por: Qian, Yu-Yang, et al.
Publicado: (2026)
Fast Large Language Model Collaborative Decoding via Speculation
por: Fu, Jiale, et al.
Publicado: (2025)
por: Fu, Jiale, et al.
Publicado: (2025)
QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache
por: Tiwari, Rishabh, et al.
Publicado: (2025)
por: Tiwari, Rishabh, et al.
Publicado: (2025)
SpecForge: A Flexible and Efficient Open-Source Training Framework for Speculative Decoding
por: Li, Shenggui, et al.
Publicado: (2026)
por: Li, Shenggui, et al.
Publicado: (2026)
Mixture of Attentions For Speculative Decoding
por: Zimmer, Matthieu, et al.
Publicado: (2024)
por: Zimmer, Matthieu, et al.
Publicado: (2024)
Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding
por: Li, Jinze, et al.
Publicado: (2025)
por: Li, Jinze, et al.
Publicado: (2025)
Traversal Verification for Speculative Tree Decoding
por: Weng, Yepeng, et al.
Publicado: (2025)
por: Weng, Yepeng, et al.
Publicado: (2025)
Faster Cascades via Speculative Decoding
por: Narasimhan, Harikrishna, et al.
Publicado: (2024)
por: Narasimhan, Harikrishna, et al.
Publicado: (2024)
InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation
por: Zhao, Weilin, et al.
Publicado: (2025)
por: Zhao, Weilin, et al.
Publicado: (2025)
Benchmarking the Energy Savings with Speculative Decoding Strategies
por: Dutta, Rohit, et al.
Publicado: (2026)
por: Dutta, Rohit, et al.
Publicado: (2026)
On Speculative Decoding for Multimodal Large Language Models
por: Gagrani, Mukul, et al.
Publicado: (2024)
por: Gagrani, Mukul, et al.
Publicado: (2024)
A Theoretical Perspective for Speculative Decoding Algorithm
por: Yin, Ming, et al.
Publicado: (2024)
por: Yin, Ming, et al.
Publicado: (2024)
Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE
por: Huang, Haiduo, et al.
Publicado: (2025)
por: Huang, Haiduo, et al.
Publicado: (2025)
SENSE: Semantic Embedding Navigation with Soft-gated Evaluation for Retrieval-based Speculative Decoding
por: Chen, Shaowen, et al.
Publicado: (2026)
por: Chen, Shaowen, et al.
Publicado: (2026)
Self-Speculative Biased Decoding for Faster Re-Translation
por: Zeng, Linxiao, et al.
Publicado: (2025)
por: Zeng, Linxiao, et al.
Publicado: (2025)
Confidence-Modulated Speculative Decoding for Large Language Models
por: Sen, Jaydip, et al.
Publicado: (2025)
por: Sen, Jaydip, et al.
Publicado: (2025)
Clover: Regressive Lightweight Speculative Decoding with Sequential Knowledge
por: Xiao, Bin, et al.
Publicado: (2024)
por: Xiao, Bin, et al.
Publicado: (2024)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
por: Zhou, Yongchao, et al.
Publicado: (2023)
por: Zhou, Yongchao, et al.
Publicado: (2023)
Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding
por: Xiao, Bin, et al.
Publicado: (2024)
por: Xiao, Bin, et al.
Publicado: (2024)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
por: Huang, Langlin, et al.
Publicado: (2025)
por: Huang, Langlin, et al.
Publicado: (2025)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
por: Yang, Penghui, et al.
Publicado: (2025)
por: Yang, Penghui, et al.
Publicado: (2025)
REST: Retrieval-Based Speculative Decoding
por: He, Zhenyu, et al.
Publicado: (2023)
por: He, Zhenyu, et al.
Publicado: (2023)
Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding
por: Ryu, Hyun, et al.
Publicado: (2024)
por: Ryu, Hyun, et al.
Publicado: (2024)
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
por: Agrawal, Sudhanshu, et al.
Publicado: (2025)
por: Agrawal, Sudhanshu, et al.
Publicado: (2025)
LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
por: Elhoushi, Mostafa, et al.
Publicado: (2024)
por: Elhoushi, Mostafa, et al.
Publicado: (2024)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
por: Huang, Kaixuan, et al.
Publicado: (2024)
por: Huang, Kaixuan, et al.
Publicado: (2024)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
por: Wen, Zhuofan, et al.
Publicado: (2024)
por: Wen, Zhuofan, et al.
Publicado: (2024)
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
por: Hong, Fenglu, et al.
Publicado: (2025)
por: Hong, Fenglu, et al.
Publicado: (2025)
Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous Vocabularies
por: Timor, Nadav, et al.
Publicado: (2025)
por: Timor, Nadav, et al.
Publicado: (2025)
Token-Driven GammaTune: Adaptive Calibration for Enhanced Speculative Decoding
por: Gautam, Aayush, et al.
Publicado: (2025)
por: Gautam, Aayush, et al.
Publicado: (2025)
Balancing Coverage and Draft Latency in Vocabulary Trimming for Faster Speculative Decoding
por: Shoham, Ofir Ben
Publicado: (2026)
por: Shoham, Ofir Ben
Publicado: (2026)
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
por: Goel, Raghavv, et al.
Publicado: (2024)
por: Goel, Raghavv, et al.
Publicado: (2024)
Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency
por: Li, Ruixiao, et al.
Publicado: (2025)
por: Li, Ruixiao, et al.
Publicado: (2025)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
por: Liu, Bingshuai, et al.
Publicado: (2025)
por: Liu, Bingshuai, et al.
Publicado: (2025)
Ejemplares similares
-
FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling
por: Zhao, Weilin, et al.
Publicado: (2025) -
HiSpec: Hierarchical Speculative Decoding for LLMs
por: Kumar, Avinash, et al.
Publicado: (2025) -
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
por: Georganas, Evangelos, et al.
Publicado: (2025) -
Online Speculative Decoding
por: Liu, Xiaoxuan, et al.
Publicado: (2023) -
QSpec: Speculative Decoding with Complementary Quantization Schemes
por: Zhao, Juntao, et al.
Publicado: (2024)